新闻中心

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

2024-08-23
浏览次数:
返回列表
总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

aixiv专栏是本站发布学术、技术内容的栏目。过去数年,本站aixiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com


该论文作者来自于鹏城实验室多智能体与具身智能研究所及南方科技大学、中山大学的师生团队,包括林倞教授(研究所所长,国家杰青,IEEE Fellow),郑锋教授,梁小丹教授,王志强(南科大),郑浩(南科大),聂云双(中大),徐文君(鹏城),叶华(鹏城)等。鹏城实验室林倞教授团队致力于打造多智能体协同与*训练平台、云端协同具身多模态大模型等通用基础平台,赋能工业互联网、社会治理与服务等重大应用需求。

今年以来,具身智能正在成为学术界和产业界的热门领域,相关的产品和成果层出不穷。今天,鹏城实验室多智能体与具身智能研究所(以下简称鹏城具身所)联合南方科技大学、中山大学正式发布并开源其最新的具身智能领域学术成果 ——ARIO(All Robots In One)具身大规模数据集,旨在解决当前具身智能领域所面临的数据获取难题。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

  • 论文题目:All Robots in One: A New Standard and Unified Dataset for Versatile.General-Purpose Embodied Agents

  • 论文链接:http://arxiv.org/abs/2408.10899

  • 项目主页:https://imaei.github.io/project_pages/ario/

  • 鹏城实验室具身所网站链接:https://imaei.github.io/

作为具身机器人的大脑,想要让具身大模型的性能更优,关键在于能否获得高质量的具身大数据。不同于大语言模型或视觉大模型用到的文本或图像数据,具身数据无法从互联网海量内容中直接获取,而需通过真实的机器人操作来采集或高级*平台生成,因此具身数据的采集需要较高的时间和成本,很难达到较大的规模。

同时,当前开源的数据集也存在多项不足,如上表所示,JD ManiData、ManiW* 和 RH20T 本身数据量不大,DROID 数据用到的机器人硬件平台比较单一,Open-X Embodiment 虽然达到了较大规模的数据量,但其感知数据模态不够丰富,而且子数据集之间的数据格式不统一,质量也参差不齐,使用数据之前需要花大量时间进行筛选和处理,难以满足复杂场景下具身智能模型的高效率和针对性的训练需求。

相比而言,此次发布的 ARIO 数据集,包含了 2D、3D、文本、触觉、声音 5 种模态的感知数据,涵盖操作导航两大类任务,既有*数据,也有真实场景数据,并且包含多种机器人硬件,有很高的丰富度。在数据规模达到三百万的同时,还保证了数据的统一格式,是目前具身智能领域同时达到高质量、多样化和大规模的开源数据集。

对于具身智能的数据集而言,由于机器人有多种形态,如单臂、双臂、人形、四足等,并且感知和控制方式也各不相同,有些通过关节角度控制,有些则是通过本体或末端位姿坐标来驱动,所以具身数据本身比单纯的图像和文本数据要复杂很多,需要记录很多控制参数。而如果没有一个统一的格式,当多种类型的机器人数据聚合到一起,需要花费大量的精力去做额外的预处理。

因此鹏城实验室具身所首先设计了一套针对具身大数据的格式标准,该标准能记录多种形态的机器人控制参数,并且有结构清晰的数据组织形式,还能兼容不同帧率的传感器并记录对应的时间戳,以满足具身智能大模型对感知和控制时序的精确要求。下图展示了 ARIO 数据集的总体设计。

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

千鹿Pr助手 千鹿Pr助手

智能Pr插件,融入众多AI功能和海量素材

千鹿Pr助手 128 查看详情 千鹿Pr助手
                             图 1. ARIO 数据集总体设计

ARIO 数据集,共有 258 个场景序列,321064 个任务,303 万个样例。ARIO 的数据有 3 大来源,一是通过布置真实环境下的场景和任务进行真人采集;二是基于 MuJoCo、Habitat 等*引擎,设计虚拟场景和物体模型,通过*引擎驱动机器人模型的方式生成;三是将当前已开源的具身数据集,逐个分析和处理,转换为符合 ARIO 格式标准的数据。下面展示了 ARIO 数据集的具体构成,以及 3 个来源的流程和示例。

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

                                图 2. ARIO 数据 3 个来源

真实场景的高质量的机器人数据不易获取,但意义重大。鹏城实验室基于 Cobot Magic 主从双臂机器人,设计了 30 多种任务,包括简单 —— 中等 —— 困难 3 个操作难易等级,并通过增加干扰物体、随机改变物体和机器人位置、改变布置环境等方式增加样例的多样性,最终得到 3000 多条包含 3 个 rgbd 相机的轨迹数据。下面展示了不同任务的采集示例以及采集视频。

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

                              图 3. ARIO 真实机器人数据采集示例总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集                           Cobot Magic 机械臂采集数据示例视频 总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集                                基于 MuJoCo 的*数据采集示例视频 总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集                               基于 Dataa SeaW*e 平台的*数据生成示例视频 总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集                              基于 Habitat 平台的*数据生成示例视频 总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集
                            从 RH20T 转换的数据示例视频

得益于 ARIO 数据的统一格式设计,能够很方便地对它的数据组成进行统计分析。下图展示了从 series、task、episode 三个层面对 ARIO 的场景(图 a)和技能(图 b)的分布进行统计。从中可见,目前大部分的具身数据都集中在室内生活家居环境中的场景和技能。

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

除了场景和技能,在 ARIO 数据中,还能从机器人本身的角度进行统计分析,并从中了解当前机器人行业的一些发展态势。 ARIO 数据集提供了机器人形态、运动对象、物理控制变量、传感器种类和安装位置、视觉传感器的数量、控制方式比例、数据采集方式比例、机械臂自由度数量比例的统计数据,对应下图 a-i。

以下图 a 为例,从中可以发现,当前大部分的数据来源于单臂机器人,人形机器人的开源数据很少,且主要来源于鹏城实验室的真实采集和*生成。

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

                                        图 5.ARIO 数据集分类统计

更多关于 ARIO 数据集的详细信息与下载链接,请参考论文原文与项目主页。

以上就是总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集的详细内容,更多请关注其它相关文章!


# 具身智能  # 广州数学之窗网站建设  # 刘连康seo视频  # 嘉兴关键词seo  # 做淘宝客导购网站推广  # 宜都市网站建设  # 汉川企业网站建设  # 南昌seo排名多少钱  # 必应下拉管家SEO  # 互联网  # 高质量  # 华纳  # 南极  # 中山大学  # 神技  # 总说  # 太贵  # 开源  # 鹏城  # type  # git  # ario 数据集  # 产业  # 常德标准网站建设费用  # 相馆网站建设费用预算 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 命令行如何运行j*a  苹果16有哪些bug  linux如何跳回命令行界面  油烟机上的power是什么意思  科技型企业成长"十步法"  md5解密是什么意思  云笔记本电脑有什么用  固态硬盘如何下载网页  固态硬盘电脑如何设置  33000日元等于多少人民币  固态硬盘如何打开软件  iPhone无法打开YouTube原因分析与解决方案  shell如何注释所有命令  望远镜上power是什么意思  linux如何调出命令行  三星 nfc什么功能是什么意思  4800日元等于多少人民币  夸克还原排版是什么意思  openwrt有哪些功能  营收和gmv区别_营收和gmv有什么区别  awful是什么意思  什么是泛域名解析  如何查看固态硬盘分区  什么是域名解析 域名解析中采用了什么  typescript多久能学会  如何用好typescript  make命令如何使用  得物怎样不扣手续费 如何通过得物不支付手续费  夸克网盘是什么都有吗  花呗征信不好如何恢复 如何修复不良的花呗征信  j*a数组怎么放字符  如何管理员打开cmd命令行窗口  typescript适合什么用  电动车充电器上的power是什么意思  固态硬盘如何判断大小  雅迪电动车上的power是什么意思  怎么看手机是不是双模5g手机  typescript能开发什么  单片机显存怎么设置最佳  阿里云盘扩容是什么_扩容阿里云盘方法是什么教程  交管12123协议头不完整怎么弄  怎么在项目中使用typescript  春运抢票在哪儿抢票  grep命令的是如何实现  如何知道固态硬盘  165开头的是什么电话号码  旧固态硬盘如何卖出  固态硬盘装完如何使用  debian和ubuntu的区别是什么  苹果16系统有哪些问题 

搜索