你在看吗?视觉与语言导航中面向多模态的接地
计算与语言
2019-06-11 v3
摘要
视觉与语言导航(VLN)需要将“向右转并在门前停下”等指令接地到视觉环境中的路线。实际的接地可通过多种模态将语言与环境相连,例如“在门前停下”可能接地到视觉对象,而“向右转”可能仅依赖路线的几何结构。我们研究了两种近期最先进 VLN 模型下自然语言经验性地接地于何处。令人惊讶的是,我们发现视觉特征实际上可能损害这些模型:在基准 Room-to-Room 数据集上,仅使用路线结构、剔除视觉特征的模型在未见新环境中的表现优于其视觉对应模型。为更好地利用所有可用模态,我们提出将接地过程分解为一组可访问不同模态(包括对象检测)的专家模型,并在预测时集成它们,从而提升 VLN 任务上最先进模型的性能。
引用
@article{arxiv.1906.00347,
title = {Are You Looking? Grounding to Multiple Modalities in Vision-and-Language Navigation},
author = {Ronghang Hu and Daniel Fried and Anna Rohrbach and Dan Klein and Trevor Darrell and Kate Saenko},
journal= {arXiv preprint arXiv:1906.00347},
year = {2019}
}
备注
ACL 2019