面向自然语言 grounded 导航的环境无关多任务学习
人工智能
2020-07-22 v5 计算与语言
计算机视觉与模式识别
机器人学
摘要
近期的研究工作使得在照片级真实感环境中研究自然语言 grounded 导航成为可能,例如遵循自然语言指令或对话进行导航。然而,现有方法倾向于过拟合已见环境中的训练数据,并且在先前未见过的环境中泛化不佳。为缩小已见与未见环境之间的差距,我们从两个新颖的角度旨在学习一个泛化的导航模型:(1) 我们引入了一个多任务导航模型,可在视觉-语言导航(Vision-Language Navigation, VLN)和基于对话历史的导航(Navigation from Dialog History, NDH)任务上无缝训练,其受益于更丰富的自然语言引导并有效跨任务迁移知识;(2) 我们提出为导航策略学习在训练期间所见环境中保持不变的环境无关表示,从而在未见环境中更好地泛化。大量实验表明,环境无关多任务学习显著缩小了已见与未见环境间的性能差距,且以此训练的导航智能体在未见环境上相对基线在 VLN 上成功率提升 16%(相对度量)、在 NDH 上目标进展提升 120%。我们向 CVDN 排行榜的提交在留出测试集上确立了 NDH 任务的新的最先进水平(state-of-the-art)。代码见 https://github.com/google-research/valan。
引用
@article{arxiv.2003.00443,
title = {Environment-agnostic Multitask Learning for Natural Language Grounded Navigation},
author = {Xin Eric Wang and Vihan Jain and Eugene Ie and William Yang Wang and Zornitsa Kozareva and Sujith Ravi},
journal= {arXiv preprint arXiv:2003.00443},
year = {2020}
}
备注
ECCV 2020