CLEAR:利用跨语言、环境无关表示改进视觉-语言导航
计算机视觉与模式识别
2022-07-06 v1 人工智能
计算与语言
机器学习
摘要
视觉-语言导航(VLN)任务要求智能体根据语言指令在环境中导航。本文旨在解决该任务中的两个关键挑战:利用多语言指令改进指令-路径对齐,以及在训练时未见过的新环境中导航。为应对这些挑战,我们提出 CLEAR:跨语言与环境无关表示。首先,我们的智能体为 Room-Across-Room 数据集中的三种语言(英语、印地语和泰卢固语)学习一种共享且视觉对齐的跨语言语言表示。我们的语言表示学习由通过视觉信息对齐的文本对引导。其次,我们的智能体通过最大化来自不同环境的语义对齐图像对(带有物体匹配约束)之间的相似性,学习环境无关的视觉表示。我们的环境无关视觉表示能够缓解由低级视觉信息引起的环境偏差。在 Room-Across-Room 数据集上的实证表明,当泛化到具有跨语言语言表示和环境无关视觉表示的未见环境时,我们的多语言智能体在所有指标上均相较强基线模型取得大幅提升。此外,我们展示了所学语言与视觉表示可成功迁移至 Room-to-Room 与协作视觉-对话导航任务,并给出了详细的定性与定量泛化及对齐分析。我们的代码可在 https://github.com/jialuli-luka/CLEAR 获取。
引用
@article{arxiv.2207.02185,
title = {CLEAR: Improving Vision-Language Navigation with Cross-Lingual, Environment-Agnostic Representations},
author = {Jialu Li and Hao Tan and Mohit Bansal},
journal= {arXiv preprint arXiv:2207.02185},
year = {2022}
}
备注
NAACL 2022 Findings (18 pages)