新路径:利用合成指令与模仿学习扩展视觉-语言导航
机器学习
2023-04-18 v3 计算与语言
计算机视觉与模式识别
机器人学
摘要
近期在视觉-语言导航(Vision-and-Language Navigation, VLN)中的研究训练强化学习(RL)智能体在逼真环境中执行自然语言导航指令,作为迈向可遵循人类指令的机器人的一步。然而,鉴于人类指令数据的稀缺以及训练环境中多样性的有限,这些智能体仍在复杂的语言落地与空间语言理解上面临困难。基于网络大规模文本和图像-文本数据集的预训练已被广泛探索,但改进有限。我们研究利用合成指令进行大规模数据增强。我们选取 500 多个以密集采样 360 度全景图捕获的室内环境,通过这些全景图构建导航轨迹,并使用高质量多语言导航指令生成器 Marky 为每条轨迹生成视觉落地的指令。我们还使用图像到图像的 GAN 从新视角合成图像观测。由此产生的 420 万条指令-轨迹对数据集比现有人工标注数据集大两个数量级,并包含更多样化的环境与视角。为高效利用此规模的数据,我们训练了一个简单的 transformer 智能体进行模仿学习。在具有挑战性的 RxR 数据集上,我们的方法优于所有现有 RL 智能体,在可见环境中将 SOTA 的 NDTW 从 71.1 提升至 79.1,在不可见测试环境中从 64.6 提升至 66.8。我们的工作指向改进指令遵循智能体的新路径,强调大规模模仿学习以及合成指令生成能力的发展。
引用
@article{arxiv.2210.03112,
title = {A New Path: Scaling Vision-and-Language Navigation with Synthetic Instructions and Imitation Learning},
author = {Aishwarya Kamath and Peter Anderson and Su Wang and Jing Yu Koh and Alexander Ku and Austin Waters and Yinfei Yang and Jason Baldridge and Zarana Parekh},
journal= {arXiv preprint arXiv:2210.03112},
year = {2023}
}
备注
CVPR 2023