Airbert:面向视觉与语言导航的域内预训练
计算机视觉与模式识别
2021-08-23 v1 人工智能
计算与语言
人机交互
机器学习
摘要
视觉与语言导航(VLN)旨在使具身智能体利用自然语言指令在真实环境中导航。鉴于领域特定训练数据的稀缺以及图像与语言输入的高度多样性,VLN 智能体对未知环境的泛化仍具挑战。近期方法探索预训练以提升泛化,然而,使用通用图像-描述数据集或现有小规模 VLN 环境是次优的,且仅带来有限提升。本工作中,我们引入 BnB,一个大规模且多样的域内 VLN 数据集。我们首先从在线租赁市场的数十万条房源中收集图像-描述(IC)对。利用 IC 对,我们进一步提出自动策略来生成数百万个 VLN 路径-指令(PI)对。我们进一步提出一种打乱损失,以改进 PI 对内部时间顺序的学习。我们使用 BnB 预训练我们的 Airbert 模型,该模型可适配判别与生成设定,并展示其在 Room-to-Room (R2R) 导航与 Remote Referring Expression (REVERIE) 基准上优于当前最优。此外,我们的域内预训练在极具挑战的少样本 VLN 评测中显著提升性能,其中我们仅使用来自少数房屋的 VLN 指令训练模型。
引用
@article{arxiv.2108.09105,
title = {Airbert: In-domain Pretraining for Vision-and-Language Navigation},
author = {Pierre-Louis Guhur and Makarand Tapaswi and Shizhe Chen and Ivan Laptev and Cordelia Schmid},
journal= {arXiv preprint arXiv:2108.09105},
year = {2021}
}
备注
To be published on ICCV 2021. Webpage is at https://airbert-vln.github.io/ linking to our dataset, codes and models