MomaGraph:基于视觉语言模型的状态感知统一场景图用于机械臂任务规划
摘要
家庭中的移动操作机械臂既需要导航又需要操作。这需要一种紧凑且富有语义的场景表示,能够捕捉目标位置、功能以及哪些部分是可操作的。场景图是自然的选择,但以往工作常常将空间关系和功能关系分离, treating scenes as static snapshots without object states or temporal updates, and overlooks information most relevant for accomplishing the current task. 为了解决这些限制,我们引入了 MomaGraph,这是一种用于具身智能体的统一场景表示,集成了空间-功能关系和部件级交互元素。然而,发展这种表示需要合适的数据和严格的评估,这些数据和评估在很大程度上缺失。因此,我们贡献了 MomaGraph-Scenes,这是第一个大规模的、以任务为导向的、在家庭环境中丰富标注的场景图数据集,以及 MomaGraph-Bench,这是一个系统化的评估套件,涵盖从高层规划到细粒度场景理解的六种推理能力。基于此基础,我们进一步开发了 MomaGraph-R1,这是一个在 MomaGraph-Scenes 上通过强化学习训练的 7B 视觉语言模型。MomaGraph-R1 预测任务导向的场景图,并在图-计划框架下作为零样本任务规划器。大量实验表明,我们的模型在开源模型中实现了最先进的结果,在基准测试上达到 71.6% 的准确率(相较于最佳基线提升了 11.4%),同时在公开基准测试中实现跨域泛化,并在真实机器人实验中实现有效迁移。
引用
@article{arxiv.2512.16909,
title = {MomaGraph: State-Aware Unified Scene Graphs with Vision-Language Model for Embodied Task Planning},
author = {Yuanchen Ju and Yongyuan Liang and Yen-Jen Wang and Nandiraju Gireesh and Yuanliang Ju and Seungjae Lee and Qiao Gu and Elvis Hsieh and Furong Huang and Koushil Sreenath},
journal= {arXiv preprint arXiv:2512.16909},
year = {2026}
}
备注
25 pages, 10 figures. Project page:https://hybridrobotics.github.io/MomaGraph/