中文

面向通用移动操作的零样本插件式交互感知导航

机器人学 2025-09-03 v1

摘要

移动操作是机器人学中的核心挑战, 使机器人能够跨越各种任务和动态日常环境协助人类。传统的移动操作方法往往难以在不同任务和环境之间普遍化, 由于缺乏大规模训练。然而, 最近在操作基础模型方面的进展在广泛的固定基座操作任务方面展示了惊人的概括能力, 但仍局限于固定环境。因此, 我们设计了一个称为MoTo的插件模块, 可与任何即插即用操作基础模型组合, 为其赋予移动操作能力。具体而言, 我们提出了一种交互感知导航策略, 用于生成机器人停靠点以实现通用的移动操作。为实现零样本能力, 我们提出了通过视觉语言模型(VLM)在多视图一致性下实现的交互关键点框架, 用于目标对象和机器人臂遵循指令, 其中固定基座操作基础模型可以被采用。我们进一步提出了用于移动基座和机器人臂的运动规划目标, 最小化两个关键点之间的距离, 并保持轨迹的物理可行性。通过这种方式, MoTo引导机器人移动到停靠点, 在该处可以成功执行固定基座操作, 并利用VLM生成和轨迹优化实现零样本移动操作, 无需任何移动操作专家数据。广泛的OVMM和真实世界实验结果表明, MoTo在成功率上分别比当前最先进的移动操作方法提高了2.68%和16.67%, 且无需额外训练数据。

关键词

引用

@article{arxiv.2509.01658,
  title  = {MoTo: A Zero-shot Plug-in Interaction-aware Navigation for General Mobile Manipulation},
  author = {Zhenyu Wu and Angyuan Ma and Xiuwei Xu and Hang Yin and Yinan Liang and Ziwei Wang and Jiwen Lu and Haibin Yan},
  journal= {arXiv preprint arXiv:2509.01658},
  year   = {2025}
}

备注

Accepted to CoRL 2025. Project Page: https://gary3410.github.io/MoTo/