中文

你在看吗?视觉与语言导航中面向多模态的接地

计算与语言 2019-06-11 v3

摘要

视觉与语言导航(VLN)需要将“向右转并在门前停下”等指令接地到视觉环境中的路线。实际的接地可通过多种模态将语言与环境相连,例如“在门前停下”可能接地到视觉对象,而“向右转”可能仅依赖路线的几何结构。我们研究了两种近期最先进 VLN 模型下自然语言经验性地接地于何处。令人惊讶的是,我们发现视觉特征实际上可能损害这些模型:在基准 Room-to-Room 数据集上,仅使用路线结构、剔除视觉特征的模型在未见新环境中的表现优于其视觉对应模型。为更好地利用所有可用模态,我们提出将接地过程分解为一组可访问不同模态(包括对象检测)的专家模型,并在预测时集成它们,从而提升 VLN 任务上最先进模型的性能。

关键词

引用

@article{arxiv.1906.00347,
  title  = {Are You Looking? Grounding to Multiple Modalities in Vision-and-Language Navigation},
  author = {Ronghang Hu and Daniel Fried and Anna Rohrbach and Dan Klein and Trevor Darrell and Kate Saenko},
  journal= {arXiv preprint arXiv:1906.00347},
  year   = {2019}
}

备注

ACL 2019