OWMM-Agent:基于多模态智能体数据合成的开放世界移动操作
机器人学
2025-06-24 v2 人工智能
摘要
导航、操作和视觉模型的快速进步使移动操作机器人在许多专业任务中具备能力。然而,由于需要对开放指令和环境进行泛化,以及基于全局场景理解和当前智能体状态集成高级决策与低级机器人控制的系统性复杂性,开放世界移动操作 (OWMM) 任务仍具有挑战。为解决这些复杂性,我们提出一种新型多模态智能体架构,维护多视图场景帧和智能体状态以进行决策,并通过函数调用控制机器人。其次的挑战是来自域迁移的幻觉。为提高智能体性能,我们进一步引入一种用于 OWMM 任务的智能体数据合成管道,以适应我们的任务域进行指令微调。我们强调,我们的微调 OWMM-VLM 是首个专为移动操作机器人设计的基础模型,集成了全局场景理解、机器人状态跟踪和多模态动作生成于单一模型之中。通过实验,我们展示我们的模型在其他基础模型(包括 GPT-4o)以及实际世界中强大的零样本泛化性能方面达到 SOTA 水平。项目页面:https://github.com/HHYHRHY/OWMM-Agent
引用
@article{arxiv.2506.04217,
title = {OWMM-Agent: Open World Mobile Manipulation With Multi-modal Agentic Data Synthesis},
author = {Junting Chen and Haotian Liang and Lingxiao Du and Weiyun Wang and Mengkang Hu and Yao Mu and Wenhai Wang and Jifeng Dai and Ping Luo and Wenqi Shao and Lin Shao},
journal= {arXiv preprint arXiv:2506.04217},
year = {2025}
}
备注
9 pages of main content, 19 pages in total