中文

LatentPilot:通过潜在视觉推理展望未来场景的视觉语言导航

计算机视觉与模式识别 2026-04-01 v1 人工智能 机器人学

摘要

现有的视觉语言导航(VLN)模型主要在过去和当前的视觉观察上进行推理,而大体忽略了由动作引起的未来视觉动态。因此,它们往往缺乏对动作与视觉世界如何变化之间因果关系的有效理解,这限制了稳健的决策。相比之下,人类能够利用动作动态的因果关系来想象近期未来,从而提高环境理解和导航选择。鼓舞于这一能力,我们提出了 LatentPilot,这是一种新范例,利用训练期间的未来观察作为有价值的数据源来学习动作条件的视觉动态,而在推理时无需访问未来帧。具体地,我们提出了一种飞轮式训练机制,不断收集在策略采样的轨迹并重新训练模型以更好地匹配智能体的行为分布,当智能体偏离过度时触发专家接管。LatentPilot 进一步学习视觉潜像标记,这些标记在连续潜空间中全局注意,并在步骤之间携带,从而作为当前输出和下一个输入,使智能体能够展望未来并推理动作如何影响后续观察。在 R2R-CE、RxR-CE 和 R2R-PE 基准测试上实现了新的最高成绩,实际机器人测试在多样化环境中也显示出 LatentPilot 对环境-动作动态理解的优越性。项目页面:https://abdd.top/latentpilot/

关键词

引用

@article{arxiv.2603.29165,
  title  = {LatentPilot: Scene-Aware Vision-and-Language Navigation by Dreaming Ahead with Latent Visual Reasoning},
  author = {Haihong Hao and Lei Chen and Mingfei Han and Changlin Li and Dong An and Yuqiang Yang and Zhihui Li and Xiaojun Chang},
  journal= {arXiv preprint arXiv:2603.29165},
  year   = {2026}
}

备注

Project page:https://abdd.top/latentpilot/