新闻中心

CVPR 2025 | 字节提出新一代数据集COCONut,比COCO粒度分割更密集

2024-04-22
浏览次数:
返回列表
AIxiv专栏是本站发布学术、技术内容的栏目。过去数年,本站AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com。

随着人工智能的发展,语言模型和生成模型获得了大量的成功并且在设计模型的过程中,模型的参数量也越来越大。对于细粒度理解任务,模型参数量也同样在增加。然而目前现有的数据集存在规模和精度的矛盾,例如 SA-1B 数据集中 99.1% 的 mask 都是机器生成的,但没有赋予语义的标签,而其他一些公开数据集也同样存在精度问题并且这些数据集的规模一般都比较小。

近期,字节跳动提出了新一代细粒度理解的数据集,针对当代深度学习模型的设计需求,给总量为 383K 的图片进行了全景分割的人工标注,最后达到了 5.18M 张 mask,是至今最大规模的带人工标签的全景分割理解数据集,命名为 COCONut。该成果已入选 CVPR2025。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

cvpr 2024 | 字节提出新一代数据集coconut,比coco粒度分割更密集

  • 论文链接:https://arxiv.org/abs/2404.08639
  • 代码和数据集链接: https://xdeng7.github.io/coconut.github.io/ 

视频展示了 COCONut 的单张图片的 mask 密度以及语义类别的统计,可以看出,数据集的语义丰富以及 mask 分割粒度精细。该数据集还支持多种理解任务,例如全景分割,实例分割,语义分割,目标检测,语义控制生成和开放词汇分割,在多项任务上,仅通过替换数据集就达到了明显的性能提升。

CVPR 2024 | 字节提出新一代数据集COCONut,比COCO粒度分割更密集

标注方法

通常只采用人工标注是非常昂贵的,这也是目前现存的大多数公开数据集规模上不去的一个重要原因。还有一些数据集直接使用模型生成的标签,但往往这种生成的标签对模型的训练不会有太大的提高,本文也验证了这一点。所以本文提出了一种新颖的标注方式,结合人工的半自动标签生成。既能保证数据标注的精度又能实现人工劳动力的节省成本,同时还能加速标注过程。

CVPR 2024 | 字节提出新一代数据集COCONut,比COCO粒度分割更密集

标注精度对比

研究者把 COCONut 和 COCO 在同一张图上的标注进行对比。从下图的对比可以看到本文提出的标注方法达到了和纯人工用 Photoshop 标注几乎一致的精度,但是在标注速度上提高了 10 倍以上。

CVPR 2024 | 字节提出新一代数据集COCONut,比COCO粒度分割更密集

CVPR 2024 | 字节提出新一代数据集COCONut,比COCO粒度分割更密集

易标AI 易标AI

告别低效手工,迎接AI标书新时代!3分钟智能生成,行业唯一具备查重功能,自动避雷废标项

易标AI 135 查看详情 易标AI
COCONut 数据集详情

和已有的 COCO 数据集相比,数据集各个类别的分布比较相近,但是在每张图的 mask 总量上是超过 COCO 数据集的,尤其是有大量单张图片有超过 100 张 mask 的情况,由此说明了 COCONut 的标注更为精细,粒度分割更密集。

CVPR 2024 | 字节提出新一代数据集COCONut,比COCO粒度分割更密集

实验验证

除了提出一个更好的训练集,研究者还发现现有的验证集不能很好的体现模型性能的提升,因此本文还提出了一个更加富有挑战性的、可以反映模型的提升的测试集,命名为 COCONut-val. 从下表可以看到,仅替换数据集,更高精度的训练集可以带来模型很大的提升,例如在全景分割上达到超过 4 个点的 PQ。然而当训练集的规模增加了之后,可以发现,用现有的测试集做测试并不能反映出模型的提升,而 COCONut-val 则能反映出模型在增加了训练集数据量之后仍然有明显的提升。

CVPR 2024 | 字节提出新一代数据集COCONut,比COCO粒度分割更密集

下图为验证集语义类别和 mask 密度的对比,可以看出新提出的验证集更具有挑战性,更能反映模型的提升。

CVPR 2024 | 字节提出新一代数据集COCONut,比COCO粒度分割更密集

了解更多实验结果可参考原论文,团队后续将在 GitHub 主页提供数据集和相应的模型公开下载。

字节跳动智能创作团队

智能创作团队是字节跳动 AI & 多媒体技术团队,覆盖了计算机视觉、音视频编辑、特效处理等技术领域,借助公司丰富的业务场景、基础设施资源和技术协作氛围,实现了前沿算法 - 工程系统 - 产品全链路的闭环,旨在以多种形式为公司内部各业务提供业界前沿的内容理解、内容创作、互动体验与消费的能力和行业解决方案。

目前,智能创作团队已通过字节跳动旗下的云服务平台火山引擎向企业开放技术能力和服务。更多大模型算法相关岗位开放中。

以上就是CVPR 2025 | 字节提出新一代数据集COCONut,比COCO粒度分割更密集的详细内容,更多请关注其它相关文章!


# cvpr2024  # coconut  # git  # 工程  # 命名为  # 企业建设网站怎么收益  # 山东专业网站优化报价  # 上街区关键词排名工具  # 咸阳网站建设seo  # 抖音推广加盟网站  # 保山网站优化策略研究  # 命令行  # 个月  # 首款  # 可以看出  # 可以看到  # 达到了  # 博客  # 提出了  # type  # onu  # 视频编辑  # 柳北区智能网络营销推广  # 花店网站建设素材图  # seo诊断软件  # 青岛网站优化推广怎么做 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 自己如何加装固态硬盘  哪个牌子的折叠屏手机好  电脑命令如何删除账号  如何进入cmd命令行  国标控制器单片机怎么接线  路由器上面的power红灯是什么意思  xdm是什么意思  单片机加热片怎么制作  智能锁type-c接口是什么  苹果16最近玩法有哪些  5g手机怎么没视频通话功能  如何找出命令行  j*a怎么读取char数组  春运抢票准备什么  如何右键打开命令窗口  混合固态硬盘如何分区  什么是夸克模组文件格式  如何区别固态硬盘  征信不好如何快速恢复 征信不好快速恢复的方法  oppo手机nfc功能是什么意思  哪些框架支持typescript  虚拟机如何用命令清除垃圾  市盈率20a21e是什么意思  苹果16系统有哪些系列  考勤机power红灯是什么意思  windows 如何连接ftp命令行  j*a map数组怎么取值  grub命令如何进dos  为什么ai老是说链接面板中缺少某些文件  苹果16会升级哪些  苹果16有哪些亮点功能  充电器上的power是什么意思  怎么确定手机是5g  春运抢票如何快速抢到票  折叠屏手机为什么有黑点  linux如何用命令修改ip  如何用ftp连接命令行  如何更新苹果ios16  电动车power灯亮是什么意思  春运抢票可以抢几次票  微信最多可以加多少好友  win7旗舰版wifi怎么打开  ao3镜像网站哪个好  一分钟等于多少秒  电信开通nfc功能是什么意思  夸克还原排版是什么意思  哪里要用typescript  j*a 怎么清空数组元素  typescript适合什么用  关系型数据库和非关系型数据库有哪些 

搜索