中文

ESceme:基于情景场景记忆的视觉与语言导航

计算机视觉与模式识别 2024-07-16 v3

摘要

视觉与语言导航(VLN)模拟一个在真实场景中遵循自然语言导航指令的视觉智能体。现有方法在未知环境导航方面取得了巨大进展,例如束搜索、预探索以及动态或分层历史编码。为平衡泛化能力与效率,我们在导航时除当前路径外,还记忆已访问的场景。本工作中,我们为 VLN 引入一种情景场景记忆(ESceme)机制,当智能体进入当前场景时唤醒其对过往访问的记忆。该情景场景记忆使智能体在下一步预测时能够展望更全局的图景。如此,智能体学会利用动态更新的信息,而非仅仅适应当前观测。我们通过增强各位置的可访问视角并在导航过程中逐步补全记忆,给出了一种简单而有效的 ESceme 实现。我们在短程(R2R)、长程(R4R)以及视觉与对话(CVDN)VLN 任务上验证了 ESceme 的优越性。我们的 ESceme 还在 CVDN 排行榜上获得第一名。代码已公开:\url{https://github.com/qizhust/esceme}。

关键词

引用

@article{arxiv.2303.01032,
  title  = {ESceme: Vision-and-Language Navigation with Episodic Scene Memory},
  author = {Qi Zheng and Daqing Liu and Chaoyue Wang and Jing Zhang and Dadong Wang and Dacheng Tao},
  journal= {arXiv preprint arXiv:2303.01032},
  year   = {2024}
}

备注

Accepted by IJCV