新闻中心

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

2024-04-01
浏览次数:
返回列表

clip长文本能力被解锁,图像检索任务表现显著提升!

一些关键细节也能被捕捉到。上海交大联合上海AI实验室提出新框架Long-CLIP

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△棕色文本为区分两张图的关键细节

Long-CLIP基于保持CLIP原始特征空间的基础上,在图像生成等下游任务中即插即用,实现长文本细粒度图像生成。

长文本-图像检索提升20%,短文本-图像检索提升6%。

解锁CLIP长文本能力

CLIP 对齐了视觉与文本模态,拥有强大的 zero-shot 泛化能力。因此,CLIP 被广泛应用在各种多模态任务中,如图像分类、文本图像检索、图像生成等。

但CLIP的一大弊病是在于长文本能力的缺失

首先,由于采用了绝对位置编码,CLIP的文本输入长度被限制在677个token。不仅如此,实验证明CLIP真正的有效长度甚至不足20个token,远远不够以表征细粒度信息。 然而,为了克服这个限制,研究者们提出了一种解决方案。通过在文本输入中引入特定的标记,使模型能够聚焦于重要的部分。这些标记在输入中的位置和数量都是事先确定的,不会超过20个token。 通过这种方式,CLIP在处理文本输入时能够

文本端的长文本缺失也限制了视觉端的能力。由于仅包含短文本,CLIP的视觉编码器也只会提取一张图片中最主要的成分,而忽略了各种细节。这对跨模态检索等细粒度任务是十分不利的。

同时,长文本的缺乏也使CLIP采取了类似bag-of-feature(BOF)的简单建模方式,不具备因果推理等复杂能力。

针对这一问题,研究人员提出了Long-CLIP模型。

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升
具体提出了两大策略:保留知识的位置编码扩充(Knowledge-Preserving Stretching of Positional Embedding)与加入核心成分对齐(Primary Component Matching)的微调策略。

保留知识的位置编码扩充

一个简单的扩充输入长度、增强长文本能力的方法是先以固定的比率 λ对位置编码进行插值,再通过长文本进行微调。

研究者们发现,CLIP的不同位置编码的训练程度是不同的。由于训练文本很可能以短文本为主,较低位的位置编码训练较为充分,能够精确地表征绝对位置,而较高位的位置编码则仅能表征其大致的相对位置。因此,对不同位置的编码进行插值的代价是不同的。

易标AI 易标AI

告别低效手工,迎接AI标书新时代!3分钟智能生成,行业唯一具备查重功能,自动避雷废标项

易标AI 135 查看详情 易标AI

基于以上观察,研究者保留了前20个位置编码,而对于剩下的57个位置编码,则以一个更大的比率λ进行插值,计算公式可表示为:
上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升
实验表明,相较于直接插值,该策略可以在支持更长的总长度的同时大幅提升在各个任务上的性能。

加入核心属性对齐的微调

仅仅引入长文本微调会使模型走入另一个误区,即一视同仁地囊括所有细节。针对这一问题,研究者们在微调中引入核心属性对齐这一策略。

具体而言,研究者们利用主成分分析(PCA)算法,从细粒度的图像特征中提取核心属性,将其余属性过滤后重建粗粒度图像特征,并将其与概括性的短文本进行对齐。这一策略既要求模型不仅能够包含更多的细节(细粒度对齐),同时还能识别并建模其中最为核心的属性(核心成分提取与粗粒度对齐)。

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△加入核心属性对齐的微调流程

即插即用在各种多模态任务中

在图文检索、图像生成等领域,Long-CLIP可即插即用地替换CLIP。

比如图文检索,Long-CLIP能够在图像与文本模态捕捉更多细粒度信息,从而可以增强相似图像和文本的区分能力,大幅提升图文检索的表现。

无论是在传统的短文本检索(COCO、Flickr30k),还是在长文本检索任务上,Long-CLIP在召回率上均有显著提升。

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△短文本-图像检索实验结果

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△长文本-图像检索实验结果

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

△长文本-图像检索可视化,棕色文本为区分两张图片的关键细节

除此之外,CLIP的文本编码器常被用于文本到图像生成模型中,如stable diffusion系列等。但由于长文本能力的缺失,用于生成图像的文本描述通常都十分简短,无法个性化地订制各种细节。

Long-CLIP可以突破77个token的限制,实现篇章级别的图像生成(右下)。

也可以在77个token内建模更多地细节,实现细粒度图像生成(右上)。

上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升

论文链接:https://arxiv.org/abs/2403.15378
代码链接:https://github.com/beichenzbc/Long-CLIP

以上就是上海交大新框架解锁CLIP长文本能力,多模态生成细节拿捏,图像检索能力显著提升的详细内容,更多请关注其它相关文章!


# 框架  # seo优化最佳方法广告  # seo推广电话多少钱  # 租房平台软文营销推广  # 楼盘网络营销推广  # 兴化网站搭建建设定制  # 贞丰网站建设  # 喜茶东坡饮营销推广  # 推广营销定制方案  # seo怎么更新  # 是在  # 插值  # 进阶  # 省电  # 提出了  # 细粒度  # 这一  # 多模  # 解锁  # 上海交大  # stable diffusion  # ai  # 宜昌白酒网站推广公司 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 光刻机分类有哪些品牌的  如何提高固态硬盘速度  台达变频器power灯是什么意思  汽车中控导航机power线是什么意思  苹果16系统有哪些系列  在遥控器中power是什么意思  夸克加载什么要会员  苹果16有哪些变化尺寸  市盈率ttm写的亏损是什么意思  如何增加固态硬盘  如何寻找和修复无法在 AI 中找到文件的问题  一年多少周  为什么夸克没有动漫  如何管理员打开cmd命令行窗口  单片机蓝牙怎么开启设备  输入命令如何换行  空调主板单片机怎么拆开  苹果16有哪些不同  adb 命令如何后台运行  关系型数据库和非关系型数据库有哪些  360手机壁纸怎么改  单片机log怎么看  typescript如何生成uuid  kingston是什么_kingston是什么意思  爱奇艺会员qq登录可以几个人用?  数组和J*A怎么打  如何在命令行执行一个jar  夸克搜题的原理是什么  光刻机是干什么用的  春运抢票软件哪个最好用  自由服务器如何做动态ip域名解析  j*a怎么保存到数组  路亚竿上的power是什么意思  手机如何ip绑定域名解析  unix时间戳是什么意思  春运抢票还用取票吗  为什么要用typescript6  element ui是什么  汽车上power是什么意思  2026年将会大爆发的15个新科技  春运抢票如何抢连坐的票  苹果16系统有哪些改变  平仓是什么意思?  硬盘和固态硬盘如何区分  j*a数组对象怎么取  春运抢票哪里最火热  typescript多久能学会  市盈率回落是什么意思  新的固态硬盘如何分区  夸克用的什么服务器 

搜索