递归视觉想象与自适应语言锚定用于视觉语言导航
计算机视觉与模式识别
2025-07-30 v1 机器人学
摘要
视觉语言导航(VLN)通常要求智能体通过遵循语言指令,在未知场景中导航至指定物体或远程区域。此类任务需要组织历史视觉观察以进行语言锚定,这对于长序列导航决策至关重要。然而,当前的智能体受困于过于详细的场景表示和模糊的视觉-语言对齐,这削弱了它们对导航友好的高层场景先验的理解,并容易导致违反语言指令的行为。为了解决这些问题,我们提出了一种导航策略,通过递归地总结沿途的视觉感知,并与指令自适应地对齐以增强语言锚定。具体而言,通过将历史轨迹结构性地建模为紧凑的神经网格,我们提出了几种递归视觉想象(RVI)技术,以激励智能体关注视觉转换和语义场景布局的规律性,而不是处理误导性的几何细节。然后,提出了一种自适应语言锚定(ALG)技术,以有目的地将学习到的情境记忆与不同的语言成分对齐。这种细粒度的语义匹配有助于准确预测导航动作和进度。我们的导航策略在具有挑战性的VLN-CE和ObjectNav任务上超越了最先进的方法,展示了我们的RVI和ALG技术在VLN中的优越性。
引用
@article{arxiv.2507.21450,
title = {Recursive Visual Imagination and Adaptive Linguistic Grounding for Vision Language Navigation},
author = {Bolei Chen and Jiaxu Kang and Yifei Wang and Ping Zhong and Qi Wu and Jianxin Wang},
journal= {arXiv preprint arXiv:2507.21450},
year = {2025}
}
备注
Submitted to AAAI 2026