中文

用于视觉与语言导航的历史感知多模态 Transformer

计算机视觉与模式识别 2023-08-21 v2 人工智能

摘要

视觉与语言导航(VLN)旨在构建遵循指令并在真实场景中导航的自主视觉智能体。为记忆先前访问的位置及所采取的动作,多数 VLN 方法利用循环状态实现记忆。相反,我们引入历史感知多模态 Transformer(HAMT)将长程历史整合进多模态决策。HAMT 通过分层视觉 Transformer(ViT)高效编码所有过去的全景观测:首先用 ViT 编码单张图像,然后建模全景观测中图像间的空间关系,最后考虑历史中全景间的时间关系。随后,它联合结合文本、历史与当前观测来预测下一步动作。我们首先使用若干代理任务(包括单步动作预测与空间关系预测)端到端训练 HAMT,再利用强化学习进一步优化导航策略。HAMT 在广泛的 VLN 任务上达到新的 SOTA,包括细粒度指令的 VLN(R2R、RxR)、高层指令的 VLN(R2R-Last、REVERIE)、对话式 VLN(CVDN)以及长程 VLN(R4R、R2R-Back)。我们证明 HAMT 对轨迹较长的导航任务尤为有效。

关键词

引用

@article{arxiv.2110.13309,
  title  = {History Aware Multimodal Transformer for Vision-and-Language Navigation},
  author = {Shizhe Chen and Pierre-Louis Guhur and Cordelia Schmid and Ivan Laptev},
  journal= {arXiv preprint arXiv:2110.13309},
  year   = {2023}
}

备注

Accepted in NeurIPS 2021; project page at https://cshizhe.github.io/projects/vln_hamt.html; corrected a typo