RoboOmni:面向 Omni-modal 场景的主动机器人操作
机器人学
2025-11-04 v3 计算与语言
计算机视觉与模式识别
摘要
多模态大语言模型 (MLLM) 的近期进步推动了视觉-语言-动作 (VLA) 模型在机器人操作中的快速发展。虽然在许多场景中效果良好,但当前方法大多依赖明确指令,而在真实世界交互中,人类很少直接给出指令。有效的协作需要机器人主动推断用户意图。在本工作中,我们提出了跨模态情境指令,这是一种意图源自语音对话、环境声音和视觉线索而非明确命令的新设定。为解决这一新设定,我们present RoboOmni,这是一个基于端到端 Omni-modal 大语言模型的 Perceiver-Thinker-Talker-Executor 框架,统一了意图识别、交互确认和动作执行。RoboOmni 在时空上融合听觉和视觉信号,以实现稳健的意图识别,同时支持直接语音交互。为解决在机器人操作中缺乏主动意图识别训练数据的问题,我们构建 OmniAction,包含 14 万个回合、5000 多位说话者、2400 个事件声音、640 个背景以及六种情境指令类型。在仿真和真实世界环境中的实验表明,RoboOmni 在成功率、推理速度、意图识别和主动协助方面均优于基于文本和基于语音识别的基线方法。
引用
@article{arxiv.2510.23763,
title = {RoboOmni: Proactive Robot Manipulation in Omni-modal Context},
author = {Siyin Wang and Jinlan Fu and Feihong Liu and Xinzhe He and Huangxuan Wu and Junhao Shi and Kexin Huang and Zhaoye Fei and Jingjing Gong and Zuxuan Wu and Yu-Gang Jiang and See-Kiong Ng and Tat-Seng Chua and Xipeng Qiu},
journal= {arXiv preprint arXiv:2510.23763},
year = {2025}
}