中文

WoMAP:面向具身开放词汇目标定位的世界模型

机器人学 2025-06-03 v1 人工智能 计算机视觉与模式识别

摘要

语言指令驱动的主动目标定位是机器人面临的一项关键挑战,需要对部分可观测环境进行高效探索。然而,最先进的方法要么难以泛化到演示数据集之外(例如模仿学习方法),要么无法生成物理接地的动作(例如 VLM)。为了解决这些局限性,我们引入了 WoMAP(用于主动感知的世界模型):一种训练开放词汇目标定位策略的方案,其:(i) 使用基于 Gaussian Splatting 的 real-to-sim-to-real 流水线进行可扩展的数据生成,无需专家演示;(ii) 从开放词汇目标检测器中蒸馏密集的奖励信号;(iii) 利用潜在世界模型进行动力学和奖励预测,以在推理时为高层动作提案提供物理接地。严格的仿真和硬件实验表明,WoMAP 在广泛的零样本目标定位任务中表现出卓越性能,与 VLM 和扩散策略基线相比,成功率分别高出 9 倍和 2 倍以上。此外,我们展示了 WoMAP 在 TidyBot 上实现了强大的泛化能力和 sim-to-real 迁移。

关键词

引用

@article{arxiv.2506.01600,
  title  = {WoMAP: World Models For Embodied Open-Vocabulary Object Localization},
  author = {Tenny Yin and Zhiting Mei and Tao Sun and Lihan Zha and Emily Zhou and Jeremy Bao and Miyu Yamane and Ola Shorinwa and Anirudha Majumdar},
  journal= {arXiv preprint arXiv:2506.01600},
  year   = {2025}
}