从无标注三维环境中学习用于视觉与语言导航
计算机视觉与模式识别
2022-08-26 v1 人工智能
摘要
在视觉与语言导航(VLN)中,具身智能体需要遵循自然语言指令在真实三维环境中进行导航。现有 VLN 方法的一个主要瓶颈是缺乏充足的训练数据,导致对未见环境的泛化能力不佳。虽然 VLN 数据通常依靠人工采集,但这种方式成本高昂且难以扩展。本工作中,我们通过提出从 HM3D 的 900 栋无标注三维建筑中自动构建大规模 VLN 数据集来解决数据稀缺问题。我们为每栋建筑生成导航图,并通过跨视角一致性将二维目标预测迁移以生成伪三维目标标签。随后,我们使用伪目标标签作为提示来微调预训练语言模型,以缓解指令生成中的跨模态鸿沟。我们所得的 HM3D-AutoVLN 数据集在导航环境与指令数量上比现有 VLN 数据集大一个数量级。我们通过实验证明,HM3D-AutoVLN 显著提升了所得 VLN 模型的泛化能力。在 SPL 指标上,我们的方法在 REVERIE 和 SOON 数据集的未见验证集划分上分别比当前最优(state of the art)提升了 7.1% 和 8.1%。
引用
@article{arxiv.2208.11781,
title = {Learning from Unlabeled 3D Environments for Vision-and-Language Navigation},
author = {Shizhe Chen and Pierre-Louis Guhur and Makarand Tapaswi and Cordelia Schmid and Ivan Laptev},
journal= {arXiv preprint arXiv:2208.11781},
year = {2022}
}
备注
ECCV 2022