中文

从 RGB 演示中学习类别级末米级导航

机器人学 2026-02-17 v2

摘要

实现移动操作机器人基座的精确定位对于成功的后续操作动作至关重要。大多数基于 RGB 的导航系统仅保证厘米级精度,使其不适用于移动操作的精确定位阶段。这一差距导致操作策略在训练演示的分布外经常执行失败。我们通过引入一种面向末米级导航的对象中心模仿学习框架,解决了这一差距,使四足移动操作机器人仅使用其 onboard 摄像头的 RGB 观察即可实现操作就绪定位。该方法将导航策略置于三个输入条件:目标图像、来自 onboard 摄像头的多视角 RGB 观察,以及指定目标对象的文本提示。语言驱动的分割模块和空间评分矩阵解码器随后提供显式的对象定位和相对姿态推理。使用来自单个对象实例的真实数据,该系统可针对具有挑战性照明和背景条件的不同未见对象实例进行泛化。为全面评估,我们引入两种指标:一种使用 ground truth 姿态的边缘对齐指标,另一种评估机器人如何在视觉上面对目标的对齐指标。在这些指标下,本策略在针对未见目标对象进行定位时,边缘对齐成功率为73.47%,对象对齐成功率为96.94%。这些结果表明,无需深度、LiDAR 或地图先验条件,即可实现末米级精确定位,为统一的移动操作提供了可扩展的路径。项目页面: https://rpm-lab-umn.github.io/category-level-last-meter-nav/

关键词

引用

@article{arxiv.2512.11173,
  title  = {Learning Category-level Last-meter Navigation from RGB Demonstrations of a Single-instance},
  author = {Tzu-Hsien Lee and Fidan Mahmudova and Karthik Desingh},
  journal= {arXiv preprint arXiv:2512.11173},
  year   = {2026}
}