中文

用于视觉与语言导航的带变长记忆的多模态Transformer

计算机视觉与模式识别 2022-07-19 v2

摘要

视觉与语言导航(VLN)是一项要求智能体遵循语言指令导航至目标位置的任务,其在移动过程中依赖于与环境的持续交互。近期基于 Transformer 的 VLN 方法通过多模态交叉注意力机制在视觉观测与语言指令间建立直接连接,取得了巨大进展。然而,这些方法通常通过使用 LSTM 解码器或将手动设计的隐藏状态用于构建循环 Transformer,将时间上下文表示为定长向量。考虑到单一固定长度向量往往不足以捕捉长期时间上下文,本文引入带变长记忆的多模态 Transformer(MTVM),通过显式建模时间上下文来实现视觉 grounding 的自然语言导航。具体而言,MTVM 使智能体能够通过将先前的激活直接存储在记忆库中来跟踪导航轨迹。为进一步提升性能,我们提出一种记忆感知一致性损失,以随机掩码指令帮助学习更好的时间上下文联合表示。我们在流行的 R2R 和 CVDN 数据集上评估 MTVM,我们的模型在 R2R 未见过验证集和测试集上的成功率各提升 2%,并在 CVDN 测试集上将目标进程(Goal Process)降低 1.6m。

关键词

引用

@article{arxiv.2111.05759,
  title  = {Multimodal Transformer with Variable-length Memory for Vision-and-Language Navigation},
  author = {Chuang Lin and Yi Jiang and Jianfei Cai and Lizhen Qu and Gholamreza Haffari and Zehuan Yuan},
  journal= {arXiv preprint arXiv:2111.05759},
  year   = {2022}
}

备注

ECCV 2022