新闻中心

北大具身智能新成果:无需训练,听指令就能灵活走位

2023-11-06
浏览次数:
返回列表

北京大学董豪团队具身导航最新成果来了:

无需额外建图和训练,只需说出导航指令,如:

Walk forward across the room and walk through the panty followed by the kitchen. Stand at the end of the kitchen

我们就能控制机器人灵活移动。

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 免费无限量使用 DeepSeek R1 模型☜☜☜

北大具身智能新成果:无需训练,听指令就能灵活走位

在此,机器人靠的是主动与大模型构成的“专家团队”沟通完成指令分析、视觉感知、完成估计和决策测试等一系列视觉语言导航关键任务。

北大具身智能新成果:无需训练,听指令就能灵活走位

目前项目主页和论文都已上线,代码即将推出:

北大具身智能新成果:无需训练,听指令就能灵活走位

机器人如何根据人类指令导航?

视觉语言导航涉及到一系列子任务,包括指令分析,视觉感知,完成估计和决策测试。

这些关键任务需要不同领域知识,它们环环相扣决定机器人的导航能力。

受到现实中专家讨论行为的启发,北大董豪团队提出DiscussN*导航系统。

作者首先以提示方式赋予LLM(大语言模型)和MLM(多模态大模型)专家角色和特定任务,激活它们的领域知识和能力,由此构建具备不同特长的视觉导航专家团队。

北大具身智能新成果:无需训练,听指令就能灵活走位

然后,作者设计了讨论问题语料库和讨论机制,遵循该机制,由LLM驱动的导航机器人可以主动发起一系列与视觉导航专家的讨论。

北大具身智能新成果:无需训练,听指令就能灵活走位

在每一步移动前,导航机器人都会与专家讨论来理解人类指令中要求的动作和提及的物体标志。

进而依据这些物体标志的类型有倾向性地对周围环境进行感知,指令完成情况估计,由此做出初步的移动决策。

北大具身智能新成果:无需训练,听指令就能灵活走位

在决策过程中,导航机器人会根据Chain-of-Thought(思维链)同时生成N个独立的预测结果,当这些预测结果之间不一致时,机器人会向决策测试专家求助,筛选出最终的移动决策。

从这个过程我们可以看到,相比传统方法需要进行额外的预训练,这个方法通过与大模型专家交互指导机器人根据人类指令移动,直接解决了机器人导航训练数据稀缺的问题

更进一步,正是由于这个特点,它也实现了零样本能力,只要遵循以上讨论流程,就能follow多样的导航指令。

短影AI 短影AI

长视频一键生成精彩短视频

短影AI 170 查看详情 短影AI

以下是DiscussN*在经典的视觉语言导航数据集Room2Room上的表现。

北大具身智能新成果:无需训练,听指令就能灵活走位

可以看到,它显著高于所有零样本方法,甚至超过两个经过训练的方法

作者进一步在Turtlebot4移动机器人上开展真实室内场景导航实验。

凭借专家角色扮演和讨论激发出的大模型强大的语言和视觉泛化能力,DiscussN*在真实世界的表现明显优于之前最优的零样本方法和经过预训练微调的方法, 展现出良好的sim-to-real迁移能力。

北大具身智能新成果:无需训练,听指令就能灵活走位

通过实验,作者进一步发现,DiscussN*产生了4个强大的能力

1、识别开放世界物体,比如“白色桌子上的机械手臂”,“椅子上的泰迪熊”。

2、识别细粒度的导航标志物体,比如“厨房柜台上的植物”,“桌上的纸箱”。

3、纠正其它专家在讨论中回复的错误信息,比如标志提取专家在从导航动作序列提取导航标志前会检查并纠正被错误分解的动作序列。

4、排除不一致的移动决策,比如决策测试专家们可以根据当前环境信息从DiscussN*预测的多个不一致的移动决策中选择最合理的一个作为最终移动决定。

“*和大模型先验是Free Lunch”

通讯作者董豪在之前的报告中提出,深入探索如何有效利用*数据和大模型从海量数据中学习到的先验知识是未来具身智能研究的发展方向。

目前受限于数据规模和探索真实环境的高昂成本,具身智能研究仍将重点关注*平台实验和*数据训练。

近期大模型的进展为具身智能提供新方向,合理发掘和利用大模型中存在的语言常识和物理世界先验将推动具身智能发展。

北大具身智能新成果:无需训练,听指令就能灵活走位

论文地址: https://arxiv.org/abs/2309.11382

以上就是北大具身智能新成果:无需训练,听指令就能灵活走位的详细内容,更多请关注其它相关文章!


# 视觉  # 北京大学  # 来了  # 的是  # 开源  # 编辑器  # 首款  # 首个  # 可以看到  # 北大  # 就能  # follow  # 机器人  # 丽江营销推广售后服务中心  # 食品类推广营销方案  # 南山区关键词seo排名优化  # 龙兴禅院网站建设  # 株洲关键词网站建设  # 怎样找推广合作网站  # 徐圩区网站建设哪家好点  # seo关键词排名优化 蜘蛛屯  # 东营自适应网站优化公司  # 芜湖工地建设招标网站 


相关栏目: 【 行业资讯67740 】 【 技术百科0 】 【 网络运营39195


相关推荐: 华为使用nfc功能是什么意思  交管12123协议头不完整怎么弄  meet是什么意思  typescript怎么解析vue TypeScript在vue中的使用最新解读  typescript怎么理解的  单身聊天app有哪些软件 2025最靠谱的单身交友软件推荐  xdm是什么意思  对应市盈率是30X是什么意思  win7怎么关闭360壁纸屏保  单片机面包板怎么插  hen是什么意思  a03怎么根据编号找文链接入口  春运大巴上抢票怎么抢票  科技型企业成长"十步法"  为什么用typescript  16苹果有哪些机型  如何查询固态硬盘寿命  苹果16有哪些不同  轩逸e-power挡位b是什么意思  春运车站抢票和网上抢票  电脑显示屏上power是什么意思  苹果16有哪些自带配件  typescript卸载不掉怎么办  j*a二数组怎么创建  gs是什么意思  j*a里数组怎么赋值  市盈率回落是什么意思  折叠屏手机选择哪个好  命令行如何运行j*a  typescript是什么类型的语言  手机如何更改固态硬盘  juice是什么意思  rxjs和typescript什么意思  typescript能干什么  启辰星power标志是什么意思  如何卸载typescript  固态硬盘坏了如何换硬盘  苹果16系统有哪些问题  进口超级维特拉三门版power是什么意思  夸克是什么用途  power在充电器上是什么意思  如何用命令打开光驱  夸克po什么意思  苹果16如何预购  grep命令的是如何实现  如何把一个命令后台运行  单片机的速度怎么求  哪些框架支持typescript  春运抢票到哪里抢票啊  typescript怎么添加css样式 

搜索