中文

面向视觉与语言导航的多模态判别模型

计算与语言 2019-06-03 v1 计算机视觉与模式识别

摘要

视觉与语言导航(VLN)是一项自然语言落地任务,智能体必须在动态环境的视觉场景上下文中解释自然语言指令,以实现规定的导航目标。成功的智能体必须具备解析不同语言风格自然语言、将其落地于可能陌生的场景、并根据模糊环境反馈进行规划与反应的能力。泛化能力受限于人工标注数据的数量。特别是,配对的视觉-语言序列数据收集成本高昂。我们开发了一个判别器,利用多模态对齐评估在VLN任务中某条指令对给定路径的解释程度。我们的研究表明,来自\citet{Fried:2018:Speaker}的高质量增强数据中,仅由我们的判别器评分的一小部分对训练VLN智能体有用,使其在未见过的环境中表现相当。我们还展示,用判别器的预训练组件热启动的VLN智能体,在未见环境中相对基准成功率35.5提升了10%。

关键词

引用

@article{arxiv.1905.13358,
  title  = {Multi-modal Discriminative Model for Vision-and-Language Navigation},
  author = {Haoshuo Huang and Vihan Jain and Harsh Mehta and Jason Baldridge and Eugene Ie},
  journal= {arXiv preprint arXiv:1905.13358},
  year   = {2019}
}

备注

Accepted at SpLU-RoboNLP 2019 (workshop at NAACL)