中文

面向连续室内环境中移动人类的自适应视觉语言导航

计算机视觉与模式识别 2026-01-07 v3 机器人学

摘要

视觉语言导航是一项挑战机器人根据自然语言指令在真实环境中导航的任务。虽然以往研究主要聚焦于静态设置,但现实世界的导航常常要应对动态的人类障碍物。因此,我们提出了一种称为自适应视觉语言导航(AdaVLN)的任务扩展,以缩小这一差距。AdaVLN 需要机器人在 populated with 动态移动人类障碍物的复杂三维室内环境中导航,为导航任务增加了模仿现实世界的复杂性层次。为支持该任务的探索,我们还提供了 AdaVLN 模拟器和 AdaR2R 数据集。AdaVLN 模拟器允许直接将完全动画化的人类模型纳入诸如 Matterport3D 等常见数据集。我们还引入了“冻结时间”机制用于导航任务和模拟器,在智能体推理期间暂停世界状态更新,以实现跨不同硬件的公平比较和实验可重复性。我们在该任务上评估了多个基线模型,分析了 AdaVLN 引入的独特挑战,并展示了其在 VLN 研究中弥合仿真到现实鸿沟的潜力。

关键词

引用

@article{arxiv.2411.18539,
  title  = {AdaVLN: Towards Visual Language Navigation in Continuous Indoor Environments with Moving Humans},
  author = {Dillon Loh and Tomasz Bednarz and Xinxing Xia and Frank Guan},
  journal= {arXiv preprint arXiv:2411.18539},
  year   = {2026}
}