中文

NaviTrace:评估视觉语言模型的具身导航能力

机器人学 2026-03-10 v3

摘要

视觉语言模型在广泛的任务和情境中展现出卓越的性能和泛化能力。将这些基础模型集成到机器人导航系统中为构建通用机器人开辟了道路。然而,评估这些模型的导航能力仍受限于高成本的真实世界试验、过于简化的仿真环境以及有限的基准数据集。我们引入 NaviTrace,一个高质量的视觉问答基准数据集,其中模型接收指令和 embodiment 类型 (人类、四足机器人、轮式机器人、自行车) 并必须输出图像空间中的 2D 导航轨迹。在 1000 组情境和 3000 多条专家轨迹上,我们系统地评估了八个最先进的 VLMs,使用新引入的语义感知轨迹评分进行评估。该指标结合了动态时间错位距离、目标端点误差以及来自每个像素语义和 embodiment 条件化惩罚的综合评分,并与人类偏好一致。我们的评估揭示了由于空间定位和目标定位不足导致的性能差距。NaviTrace 为实际机器人导航建立了一个可扩展且可复现的基准数据集。该基准数据集和排行榜可在 https://leggedrobotics.github.io/navitrace_webpage/ 查看。

关键词

引用

@article{arxiv.2510.26909,
  title  = {NaviTrace: Evaluating Embodied Navigation of Vision-Language Models},
  author = {Tim Windecker and Manthan Patel and Moritz Reuss and Richard Schwarzkopf and Cesar Cadena and Rudolf Lioutikov and Marco Hutter and Jonas Frey},
  journal= {arXiv preprint arXiv:2510.26909},
  year   = {2026}
}

备注

11 pages, 6 figures, with appendix, accepted to ICRA 2026