新闻中心

基于信息论的校准技术,CML让多模态机器学习更可靠

2023-06-27
浏览次数:
返回列表

多模态机器学习在各种场景下都取得了令人瞩目的进展。然而,多模态学习模型的可靠性尚缺乏深入研究。「信息是消除的不确定性」,多模态机器学习的初衷与这是一致的——增加的模态可以使得预测更为准确和可靠。然而,最近发表于 ICML2025 的论文《Calibrating Multimodal Learning》发现当前多模态学习方法违法了这一可靠性假设,并做出了详细分析和矫正。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

基于信息论的校准技术,CML让多模态机器学习更可靠图片


  • 论文 Arxiv:https://arxiv.org/abs/2306.01265
  • 代码 GitHub:https://github.com/QingyangZhang/CML

当前的多模态分类方法存在不可靠的置信度,即当部分模态被移除时,模型可能产生更高的置信度,违反了信息论中 「信息是消除的不确定性」这一基本原理。针对此问题,本文提出校准多模态学习(Calibrating Multimodal Learning)方法。该方法可以部署到不同的多模态学习范式中,提升多模态学习模型的合理性和可信性。

基于信息论的校准技术,CML让多模态机器学习更可靠图片

该工作指出,当前多模态学习方法存在不可靠的预测置信度问题,现有多模态机器学习模型倾向于依赖部分模态来估计置信度。特别地,研究发现,当前模型估计的置信度在某些模态被损坏时反而会增加。为了解决这个不合理问题,作者提出了一个直观的多模态学习原则:当移除模态时,模型预测置信度不应增加。但是,当前的模型却倾向于相信部分模态,容易受到这个模态的影响,而不是公平地考虑所有模态。这进一步影响了模型的鲁棒性,即当某些模态被损坏时,模型很容易受到影响。

基于信息论的校准技术,CML让多模态机器学习更可靠

为了解决上述问题,目前一些方法采用了现有的不确定性校准方法,例如 Temperature Scaling 或贝叶斯学习方法。这些方法可以构建比传统训练 / 推理方式更准确的置信度估计。但是,这些方法只是使最终融合结果的信心估计与正确率匹配,并没有明确考虑模态信息量与信心之间的关系,因此,无法本质上提升多模态学习模型的可信性。

作者提出了一个新的正则化技术,称为 “Calibrating Multimodal Learning (CML)”。该技术通过添加一项惩罚项来强制模型预测信心与信息量的匹配关系,以实现预测置信度和信息量之间的一致性。该技术基于一种自然的直觉,即当移除一个模态时,预测置信度应该降低(至少不应该增加),这可以内在地提高置信度校准。具体来说,提出了一种简单的正则化项,通过对那些当移除一个模态时预测置信度会增加的样本添加惩罚,来强制模型学习直观的次序关系:

基于信息论的校准技术,CML让多模态机器学习更可靠

基于信息论的校准技术,CML让多模态机器学习更可靠

上面的约束为正则损失,当模态信息移除信心上升时作为惩罚出现。

实验结果表明,CML 正则化可以显著提高现有多模态学习方法的预测置信度的可靠性。此外,CML 还可以提高分类精度,并提高模型的鲁棒性。

基于信息论的校准技术,CML让多模态机器学习更可靠

多模态机器学习在各种情境中取得了显著的进展,但是多模态机器学习模型的可靠性仍然是一个需要解决的问题。本文通过广泛的实证研究发现,当前多模态分类方法存在预测置信度不可靠的问题,违反了信息论原则。针对这一问题,研究人员提出了 CML 正则化技术,该技术可以灵活地部署到现有的模型,并在置信度校准、分类精度和模型鲁棒性方面提高性能。相信这个新技术将在未来的多模态学习中发挥重要作用,提高机器学习的可靠性和实用性。

以上就是基于信息论的校准技术,CML让多模态机器学习更可靠的详细内容,更多请关注其它相关文章!


# 机器学习  # 营销推广课程总结报告  # 泉州seo推广经验  # 自贡seo网络推广推荐  # 下载使用  # 最全  # 站上  # 腾讯  # 不可靠  # 这一  # 移除  # 提出了  # 模态  # 多模  # 模型  # 网站建设涉及的软件操作  # 唐山网站建设流程图  # seo调整关键词  # 网站建设省钱技巧分析报告  # 西藏网站综合优化  # 德克士网站建设美丽  # 陕西抖音seo教程 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 干股是什么意思  折叠手机屏易坏吗为什么  夸克po什么意思  adb 命令如何后台运行  为什么要出折叠屏手机  ensp命令如何提示  制冰机power1灯亮是什么意思  python和typescript学哪个  j*a数组求和怎么算  如何编写一个linux命令  笔记本电脑多少钱  空调控制面板power灯一直亮是什么意思  春运抢票极速版怎么抢票  如何用固态硬盘做缓存  16苹果有哪些机型  a股等权平均市盈率是什么意思  如何注释typescript  春运抢票要用抢票软件吗  typescript用在哪里  j*a数组怎么保存类  单身交友必备软件  折叠屏手机为什么有黑点  NoSQL数据库有哪些特点  苹果16主打颜色有哪些  苹果16最近玩法有哪些  如何在命令行执行存储过程  夸克网盘下载为什么要钱  如何设置sql命令  如何安装m.2固态硬盘  如何弄坏固态硬盘  空调主板单片机怎么拆开  市盈率300是什么意思  电脑type-c接口是什么意思  手机如何更改固态硬盘  楔子是什么意思  typescript中如何定义json  苹果手机16系统有哪些  怎么在typescript定义集合  网络光刻机是干什么用的  夸克链信有什么用  净水器上的power是什么意思  三星相机里power是什么意思  开机如何进入命令行模式  命令行下如何导出数据库  j*a二数组怎么创建  如何在命令提示符播放音频  j*a怎么声明byte数组  linux命令行如何使用中文输入法  华为5g手机怎么用4g网络  xdm是什么意思 

搜索