中文

MoMa-Kitchen:面向可供性定位的移动操作最后一英里导航的 10 万+ 基准

机器人学 2025-03-17 v1 人工智能 计算机视觉与模式识别

摘要

在移动操作中,导航和操作通常被视为独立的问题,这导致仅仅靠近物体与有效地与物体交互之间存在显著差距。许多导航方法主要通过与目标的接近程度来定义成功,往往忽略了为后续操作提供便利的最佳定位的必要性。为了解决这一问题,我们引入了 MoMa-Kitchen,这是一个包含超过 10 万个样本的基准数据集,为模型学习最佳最终导航位置以实现向操作的无缝过渡提供训练数据。我们的数据集包含从多样化的厨房环境中收集的基于可供性的地面标签,在这些环境中,不同型号的移动操作机器人在杂乱环境中尝试抓取目标物体。使用全自动流水线,我们模拟了多样化的真实世界场景,并为最佳操作位置生成可供性标签。视觉数据从安装在机械臂上的第一人称视角相机捕获的 RGB-D 输入中收集,以确保数据收集过程中视角的一致性。我们还开发了一个轻量级基线模型 NavAff,用于导航可供性定位,该模型在 MoMa-Kitchen 基准上展现出良好的性能。我们的方法使模型能够学习基于可供性的最终定位,以适应不同的机械臂类型和平台高度,从而为具身智能中导航与操作更鲁棒和可泛化的集成铺平道路。项目页面:\href{https://momakitchen.github.io/}{https://momakitchen.github.io/}。

关键词

引用

@article{arxiv.2503.11081,
  title  = {MoMa-Kitchen: A 100K+ Benchmark for Affordance-Grounded Last-Mile Navigation in Mobile Manipulation},
  author = {Pingrui Zhang and Xianqiang Gao and Yuhan Wu and Kehui Liu and Dong Wang and Zhigang Wang and Bin Zhao and Yan Ding and Xuelong Li},
  journal= {arXiv preprint arXiv:2503.11081},
  year   = {2025}
}