新闻中心

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

2023-12-04
浏览次数:
返回列表

为了应对多模态大语言模型中视觉信息提取不充分的问题,哈尔滨工业大学(深圳)的研究人员提出了双层知识增强的多模态大语言模型-九天(JiuTian-LION)。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

需要重新写的内容是:论文链接:https://arxiv.org/abs/2311.11860

GitHub: https://github.com/rshaojimmy/JiuTian 

项目主页: https://rshaojimmy.github.io/Projects/JiuTian-LION

VALL-E VALL-E

VALL-E是一种用于文本到语音生成 (TTS) 的语言建模方法

VALL-E 134 查看详情 VALL-E

与现有的工作相比,九天首次分析了图像级理解任务和区域级定位任务之间的内部冲突,提出了分段指令微调策略和混合适配器来实现两种任务的互相提升。

通过注入细粒度空间感知和高层语义视觉知识,九天实现了在包括图像描述、视觉问题、和视觉定位等17个视觉语言任务上显著的性能提升( 比如Visual Spatial Reasoning 上高达5% 的性能提升),在其中13个评测任务上达到了国际领先水平,性能对比如图1所示。

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

图1:对比其他MLLMs,九天在大部分任务上都取得了最优的性能。

九天JiuTian-LION

通过赋予大型语言模型(LLMs)多模态感知能力,一些工作开始生成多模态大语言模型(MLLMs),并在许多视觉语言任务上取得了突破性进展。然而,现有的MLLMs主要采用图文对预训练得到的视觉编码器,如CLIP-ViT

这些视觉编码器的主要任务是学习图像层面的粗粒度图像文本模态对齐,但是它们缺乏全面的视觉感知和信息抽取能力,无法进行细粒度的视觉理解

在很大程度上,这种视觉信息提取不足和理解程度不够的问题会导致MLLMs存在视觉定位偏差、空间推理不足和物体幻觉等多个缺陷,如图2所示

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

请参考图2:九天(JiuTian-LION)是一种采用双层视觉知识增强的多模态大语言模型

九天相较于现有的多模态大语言模型(MLLMs),通过注入细粒度空间感知视觉知识和高层语义视觉证据,有效地提升了MLLMs的视觉理解能力,生成更准确的文本回应,减少了MLLMs的幻觉现象

双层视觉知识增强的多模态大语言模型-九天(JiuTian-LION)

为了解决MLLMs在视觉信息提取和理解方面存在的不足,研究人员提出了一种双层视觉知识增强的MLLMs方法,被称为九天(JiuTian-LION)。具体的方法框架如图3所示

该方法主要从两方面增强MLLMs,渐进式融合细粒度空间感知视觉知识(Progressive Incorporation of Fine-grained Spatial-aware Visual knowledge)和软提示下的高层语义视觉证据(Soft Prompting of High-level Semantic Visual Evidence)。

具体来说,研究人员提出了一种分段指令微调策略,以解决图像级理解任务和区域级定位任务之间的内部冲突。他们逐步将细粒度的空间感知知识注入到MLLMs中。同时,他们将图像标签作为高层语义视觉证据加入MLLMs,并使用软提示方法来减轻不正确标签可能带来的负面影响

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

九天(JiuTian-LION)模型框架图如下所示:

该工作通过分段式训练策略先分别基于Q-Former 和 Vision Aggregator – MLP 两个分支学习图像级理解和区域级定位任务,然后在最后训练阶段利用具有路由机制的混合适配器来动态融合不同分支的知识提升模型在两种任务的表现。

该工作还通过RAM提取图像标签作为高层语义视觉证据,然后提出软提示方法来提高高层语义注入的效果

渐进式融合细粒度空间感知视觉知识

当直接将图像级理解任务(包括图像描述和视觉问答)与区域级定位任务(包括指示表达理解,指示表达生成等)进行单阶段混合训练时,MLLMs 会遭遇两种任务之间存在的内部冲突,从而不能在所有任务上取得较好的综合性能。

研究人员认为这种内部冲突主要由两个问题引起。第一个问题是缺少区域级的模态对齐预训练,当前具有区域级定位能力的 MLLMs 大多先使用大量相关数据进行预训练,不然很难在有限地训练资源下让基于图像级模态对齐的视觉特征适应区域级任务。

另一个问题是图像级理解任务和区域级定位任务之间的输入输出模式差异,后者需要模型额外理解关于物体坐标的特定短句(以横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%的形式)。为了解决以上问题,研究人员提出了分段式指令微调策略,以及具有路由机制的混合适配器。

如图4所示,研究人员将单阶段指令微调过程拆分为三阶段:

使用ViT、Q-Former和图像级适配器学习全局视觉知识的图像级理解任务;使用Vision Aggregator、MLP和区域级适配器学习细粒度空间感知视觉知识的区域级定位任务;提出了具有路由机制的混合适配器,动态融合不同分支中学习到的不同粒度的视觉知识。表3显示了分段式指令微调策略相对于单阶段训练的性能优势

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

图4:分段式指令微调策略


横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

对于注入软提示下的高层语义视觉证据,需要进行重写处理

研究人员提出使用图像标签作为高层语义视觉证据的有效补充,以进一步增强MLLMs的全局视觉感知理解能力

具体来说,首先通过 RAM 提取图像的标签,然后利用特定的指令模版“According to , you are allowed to use or partially use the following tags:”包装图像标签。该指令模版中的“”会被替换为一个可学习的软提示向量。

配合模版中特定短语“use or partially use”,软提示向量可以指导模型减轻不正确标签带来的潜在负面影响。

实验结果

研究人员在包括图像描述(image captioning)、视觉问答(VQA)、和指示表达理解(REC)等17个任务基准集上进行了评测。

实验结果表明,九天在13个评测集上达到了国际领先水平。特别的,相比较 InstructBLIP 和 Shikra,九天分别在图像级理解任务和区域级定位任务上取得了全面且一致的性能提升,在 Visual Spatial Reasoning (VSR) 任务上可达到最高5%的提升幅度。

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

从图5可以看出,在不同的视觉语言多模态任务中,九天和其他MLLMs的能力存在差异,表明九天在细粒度视觉理解和视觉空间推理能力方面表现更优秀,并且能够输出具有更少幻觉的文本回应

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

重写的内容是:第五张图展示了对九天大模型、InstructBLIP和Shikra的能力差异进行的定性分析

图6通过样本分析,表明了九天模型在图像级和区域级视觉语言任务上都具有优秀的理解和识别能力。

横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%

第六张图:通过更多例子的分析,从图像和区域级视觉理解的角度展示了九天大模型的能力

总结

(1)该工作提出了一个新的多模态大语言模型-九天:通过双层视觉知识增强的多模态大语言模型。

(2)该工作在包括图像描述、视觉问答和指示表达理解等17个视觉语言任务基准集上进行评测,其中13个评测集达到了当前最好的性能。

(3)这项工作提出了一种分段式指令微调策略,以解决图像级理解和区域级定位任务之间的内部冲突,并实现了两种任务之间的相互提升

(4)该工作成功将图像级理解和区域级定位任务进行整合,多层次全面理解视觉场景,未来可以将这种全面的视觉理解能力应用到具身智能场景,帮助机器人更好、更全面地识别和理解当前环境,做出有效决策。

以上就是横扫13个视觉语言任务!哈工深发布多模态大模型「九天」,性能直升5%的详细内容,更多请关注其它相关文章!


# 训练  # follow  # 多模  # 直升  # 提出了  # 所示  # 两种  # 细粒度  # ai  # 六枝特区网络推广微信营销  # 宝山抖音seo运营推广  # 网站推广局限性是什么  # seo站长交流  # 饿了么网站推广哪个好  # seo和sem哪种客户需要  # seo顾问赚钱多少  # 网站霸屏推广定制  # 丹东网站建设平台介绍  # 狼道seo  # 是一种  # 麦当劳  # 开源  # 如图 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: cron表达式在线工具有哪些  春运车站抢票和网上抢票  折叠屏手机为什么这么小  怎么在typescript写原型链  sausage是什么意思  固态硬盘如何查看盘符  ao3镜像网站哪个好  夸克学习都有什么课程  win10如何开启命令行  汽车上power是什么意思  intel固态硬盘如何安装  shell如何注释所有命令  16苹果有哪些机型  手机拍显示屏有条纹怎么去除  nosql数据库的应用场景有哪些  苹果手机16有哪些功能  固态硬盘如何启动  市盈率是负数是什么意思  unix时间戳转换公式  typescript属性只读如何修改  苹果16哪些型号好  5r是多少钱  typescript如何生成uuid  液位传感器power是什么意思  苹果16充电方式有哪些  如何设置从固态硬盘启动  typescript变量是什么  awk命令如何对两列加分隔符  固态硬盘如何备份  如何用ftp连接命令行  单片机显存怎么设置最佳  固态硬盘坏了如何换硬盘  如何用chown命令  excel中datediff函数怎么用  vb中的datediff函数怎么用 ​VB中的DateDiff函数:详尽指南  市盈率负值是什么意思  vi命令如何退出  为什么ai老是说链接面板中缺少某些文件  固态硬盘电脑如何设置  shell如何执行sql脚本命令行  如何用adb命令停用系统软件  夸克为什么老是投屏失败  如何安装大华固态硬盘  春运抢票失败怎么抢  双十一的哪一天最优惠呢  typescript和nodejs哪个好  春运抢票多久可以买到票  5G类似微信的聊天软件有哪些  a股等权平均市盈率是什么意思  苹果16哪些会降价的 

搜索