中文

Dual-Anchoring:解决视觉语言导航中的状态漂移

计算机视觉与模式识别 2026-05-22 v2 人工智能

摘要

视觉语言导航 (VLN) 需要智能体通过跟随自然语言指令在 3D 环境中导航。尽管近期的视频大型语言模型 (Video-LLMs) 在 VLN 中取得了显著进展,但它们在长时间场景中高度易受状态漂移 (State Drift) 的影响。在这种情况下,智能体的内部状态会偏离真实的任务执行状态,导致无目的漫游,无法执行关键机动动作。我们认为这种失败源于两种认知缺陷:进度漂移 (Progress Drift),即智能体无法区分已完成的子目标与剩余目标;记忆漂移 (Memory Drift),即智能体的历史表示退化,导致其丢失已访问地标的跟踪。为此,我们提出 Dual-Anchoring 框架,通过显式锚定指令进度和历史表示来解决。首先,为解决进度漂移,我们引入指令进度锚定 (Instruction Progress Anchoring),监督智能体生成结构化文本标记,界定已完成与剩余子目标。其次,为缓解记忆漂移,我们提出记忆地标锚定 (Memory Landmark Anchoring),利用地标中心世界模型,对比 Segment Anything Model 提取的对象中心嵌入,迫使智能体明确核查过去观察并保持已访问地标的独特表示。为支持此框架,我们构建了两个大规模数据集:360 万样本包含显式进度描述,93.7 万样本包含基于地标的回顾性验证。大量实验在模拟和真实环境中表明,我们方法的优越性,在长程轨迹上实现了 15.2% 的成功率提升和 24.7% 的显著增益。为促进进一步研究,我们将发布代码、数据生成管道以及收集的数据集。

关键词

引用

@article{arxiv.2604.17473,
  title  = {Dual-Anchoring: Addressing State Drift in Vision-Language Navigation},
  author = {Kangyi Wu and Pengna Li and Kailin Lyu and Xi Lin and Lin Zhao and Qingrong He and Jinjun Wang and Jianyi Liu},
  journal= {arXiv preprint arXiv:2604.17473},
  year   = {2026}
}