中文

从梦中召回:基于想象引导的记忆持久化视觉语言导航经验检索

计算机视觉与模式识别 2026-03-31 v2 人工智能 机器人学

摘要

视觉语言导航要求智能体通过环境中的自然语言指令导航,记忆持久化变体要求通过积累的经验实现持续改进。现有记忆持久化 VLN 方法面临关键局限:缺乏有效的记忆访问机制,仅依赖整体记忆纳入或固定视野查找,且主要存储环境观察,忽略编码有价值决策策略的导航行为模式。我们提出 Memoir 框架,运用想象作为检索机制并由显式记忆支撑:世界模型将未来导航状态想象为查询,以选择性检索相关环境观察和行为历史。方法包括:1)语言条件化世界模型,将想象未来状态用于编码经验存储和生成检索查询;2)混合视点级记忆,将观察和行为模式锚定到视点,实现混合检索;3)经验增强型导航模型,集成检索知识的专用编码器。广泛评估表明,Memoir 在八个多样化的记忆持久化 VLN 基准测试中表现突出,10 种不同测试场景均取得显著提升,IR2R 上相比最佳记忆持久化基线提升 5.4% SPL,伴随 8.3 倍训练加速和 74% 推理内存降低。结果表明,预测检索环境和行为记忆可实现更有效的导航,分析显示该想象引导范式仍有显著提升空间(73.3% vs 93.4% 上限)。

关键词

引用

@article{arxiv.2510.08553,
  title  = {Dream to Recall: Imagination-Guided Experience Retrieval for Memory-Persistent Vision-and-Language Navigation},
  author = {Yunzhe Xu and Yiyuan Pan and Zhe Liu},
  journal= {arXiv preprint arXiv:2510.08553},
  year   = {2026}
}

备注

Accepted by IEEE Transactions on Pattern Analysis and Machine Intelligence (TPAMI)