EnvEdit:面向视觉与语言导航的环境编辑
计算机视觉与模式识别
2022-03-30 v1 人工智能
计算与语言
摘要
在视觉与语言导航(VLN)中,智能体需根据自然语言指令在环境中导航。由于可用于智能体训练的数据有限且导航环境多样性不足,智能体难以泛化到新的、未见过的环境。为解决此问题,我们提出 EnvEdit,一种通过对现有环境进行编辑来创建新环境的数据增强方法,用于训练更具泛化能力的智能体。我们增强的环境可在风格、物体外观与物体类别三个不同方面区别于已见环境。在这些编辑增强的环境上训练可防止智能体对现有环境过拟合,并有助于更好地泛化到新的、未见过的环境。在经验上,在 Room-to-Room 与多语言 Room-Across-Room 数据集上,我们表明所提 EnvEdit 方法在预训练与非预训练 VLN 智能体上均取得所有指标显著提升,并在测试排行榜上达到新的 SOTA。我们进一步集成在不同编辑环境上增强的 VLN 智能体,并表明这些编辑方法具有互补性。代码与数据见 https://github.com/jialuli-luka/EnvEdit
引用
@article{arxiv.2203.15685,
title = {EnvEdit: Environment Editing for Vision-and-Language Navigation},
author = {Jialu Li and Hao Tan and Mohit Bansal},
journal= {arXiv preprint arXiv:2203.15685},
year = {2022}
}
备注
CVPR 2022 (17 pages)