基于可供性引导的由粗到精探索:面向开放词汇移动操作中的基座放置
机器人学
2026-01-06 v2 人工智能
摘要
在开放词汇移动操作(OVMM)中,任务成功通常取决于为机器人选择合适的基座放置位置。现有方法通常导航到基于邻近性的区域,而不考虑可供性,导致频繁的操作失败。我们提出了一种基于可供性引导的由粗到精探索方法,这是一种零样本的基座放置框架,通过迭代优化过程,将视觉-语言模型(VLM)的语义理解与几何可行性相结合。我们的方法构建了跨模态表示,即可供性RGB图和障碍物地图+,以将语义与空间上下文对齐。这使得推理能够超越RGB感知的自我中心限制。为了确保交互由任务相关的可供性引导,我们利用来自VLM的粗粒度语义先验来引导搜索朝向任务相关区域,并通过几何约束细化放置,从而降低收敛到局部最优的风险。在五个不同的开放词汇移动操作任务上评估,我们的系统实现了85%的成功率,显著优于经典的几何规划器和基于VLM的方法。这证明了在OVMM中,具有可供性感知和多模态推理的通用、指令条件规划的前景。
引用
@article{arxiv.2511.06240,
title = {Affordance-Guided Coarse-to-Fine Exploration for Base Placement in Open-Vocabulary Mobile Manipulation},
author = {Tzu-Jung Lin and Jia-Fong Yeh and Hung-Ting Su and Chung-Yi Lin and Yi-Ting Chen and Winston H. Hsu},
journal= {arXiv preprint arXiv:2511.06240},
year = {2026}
}
备注
Accepted to AAAI 2026