中文

重构肉体性差距:视觉-语言导航中的物理与视觉差异的全面研究

机器人学 2025-09-29 v2 人工智能 计算与语言 计算机视觉与模式识别

摘要

近期视觉-语言导航(VLN)进展令人振奋,但其关于机器人运动和控制的理想化假设未能反映肉体化部署的挑战。为弥合这一差距,我们引入 VLN-PE,一个支持人形、四足和轮式机器人人的物理真实 VLN 平台。首次系统评估了多个 ego-centric VLN 方法在物理机器人环境中的表现,包括用于单步离散动作预测的分类模型、用于稠密路径点预测的扩散模型,以及集成路径规划的无训练大语言模型(LLM)。我们的结果揭示了由于机器人观测空间受限、环境光照变化以及物理挑战(如碰撞和跌倒)导致的显著性能下降。这也暴露了四足机器人在复杂环境中的 locomotion 约束。VLN-PE 高度可扩展,允许无缝集成 MP3D 之外的新场景,从而实现更全面的 VLN 评估。尽管当前模型在物理部署中的泛化较弱,VLN-PE 为提高跨肉体性适应性提供了新途径。我们希望我们的发现和工具激励社区重新思考 VLN 限制并推进稳健、实用 VLN 模型。代码地址为 https://crystalsixone.github.io/vln_pe.github.io/。

关键词

引用

@article{arxiv.2507.13019,
  title  = {Rethinking the Embodied Gap in Vision-and-Language Navigation: A Holistic Study of Physical and Visual Disparities},
  author = {Liuyi Wang and Xinyuan Xia and Hui Zhao and Hanqing Wang and Tai Wang and Yilun Chen and Chengju Liu and Qijun Chen and Jiangmiao Pang},
  journal= {arXiv preprint arXiv:2507.13019},
  year   = {2025}
}

备注

Accepted by ICCV 2025