用于视觉与语言导航的片段式 Transformer
计算机视觉与模式识别
2021-08-26 v2 人工智能
摘要
在动态环境中由自然语言指令定义的交互与导航,对神经智能体提出了重大挑战。本文致力于解决两个挑战:处理长序列子任务,以及理解复杂的人类指令。我们提出片段式 Transformer(E.T.),一种对语言输入以及视觉观测与动作的全部片段历史进行编码的多模态 transformer。为改进训练,我们利用合成指令作为一种中间表示,将理解环境的视觉外观与自然语言指令的变体解耦。我们证明用 transformer 编码历史对解决组合任务至关重要,且用合成指令进行预训练与联合训练进一步提升了性能。我们的方法在具有挑战性的 ALFRED 基准上达到了新的最优水平,在可见与不可见测试划分上分别取得 38.4% 和 8.5% 的任务成功率。
引用
@article{arxiv.2105.06453,
title = {Episodic Transformer for Vision-and-Language Navigation},
author = {Alexander Pashevich and Cordelia Schmid and Chen Sun},
journal= {arXiv preprint arXiv:2105.06453},
year = {2021}
}
备注
ICCV 2021; 19 pages; Code available at https://github.com/alexpashevich/E.T