中文

CapNav:基于能力条件的室内导航基准测试

计算机视觉与模式识别 2026-02-23 v1 机器人学

摘要

视觉语言模型(VLM)在视觉语言导航(VLN)方面取得了显著进展,为导航决策提供了新的可能性,既可惠及机器人平台,也可惠及人类用户。然而,实际导航本质上取决于代理人的 mobility 限制。例如,扫地机器人无法跨越楼梯,而四足动物则可以。我们引入能力条件导航(CapNav),一个旨在评估VLM在给定特定物理和操作能力限制下的导航能力的基准测试。CapNav定义了五种典型的人类和机器人代理,每种代理描述其物理尺寸、mobility能力和环境交互能力。CapNav提供了45个真实室内场景、473个导航任务和2365个问答对,用于测试VLM是否能基于代理能力在室内环境中进行导航。我们评估了13个现代VLM,发现当前VLM的导航性能会随着mobility限制的加剧而显著下降,即使是最先进的模型在需要对空间维度进行推理的障碍类型上也难以应对。我们通过讨论能力感知导航的意义以及未来VLM在具身空间推理方面的机遇来作结。该基准测试可在 https://github.com/makeabilitylab/CapNav 获取。

关键词

引用

@article{arxiv.2602.18424,
  title  = {CapNav: Benchmarking Vision Language Models on Capability-conditioned Indoor Navigation},
  author = {Xia Su and Ruiqi Chen and Benlin Liu and Jingwei Ma and Zonglin Di and Ranjay Krishna and Jon Froehlich},
  journal= {arXiv preprint arXiv:2602.18424},
  year   = {2026}
}