ESceme:基于情景场景记忆的视觉与语言导航
计算机视觉与模式识别
2024-07-16 v3
摘要
视觉与语言导航(VLN)模拟一个在真实场景中遵循自然语言导航指令的视觉智能体。现有方法在未知环境导航方面取得了巨大进展,例如束搜索、预探索以及动态或分层历史编码。为平衡泛化能力与效率,我们在导航时除当前路径外,还记忆已访问的场景。本工作中,我们为 VLN 引入一种情景场景记忆(ESceme)机制,当智能体进入当前场景时唤醒其对过往访问的记忆。该情景场景记忆使智能体在下一步预测时能够展望更全局的图景。如此,智能体学会利用动态更新的信息,而非仅仅适应当前观测。我们通过增强各位置的可访问视角并在导航过程中逐步补全记忆,给出了一种简单而有效的 ESceme 实现。我们在短程(R2R)、长程(R4R)以及视觉与对话(CVDN)VLN 任务上验证了 ESceme 的优越性。我们的 ESceme 还在 CVDN 排行榜上获得第一名。代码已公开:\url{https://github.com/qizhust/esceme}。
引用
@article{arxiv.2303.01032,
title = {ESceme: Vision-and-Language Navigation with Episodic Scene Memory},
author = {Qi Zheng and Daqing Liu and Chaoyue Wang and Jing Zhang and Dadong Wang and Dacheng Tao},
journal= {arXiv preprint arXiv:2303.01032},
year = {2024}
}
备注
Accepted by IJCV