中文

视觉与语言导航中基于贝叶斯规则的生成式语言接地策略

计算与语言 2020-10-09 v3

摘要

视觉与语言导航(VLN)是一项智能体具身于真实三维环境并遵循指令到达目标节点的任务。尽管此前多数研究构建并考察了判别式方法,我们注意到构建此类VLN智能体事实上存在两种可能途径:判别式与生成式。本文设计并考察了一种生成式语言接地策略,其使用语言模型计算给定动作与转移历史下所有可行指令(即所有词汇标记可能序列)上的分布。实验中,我们表明所提生成式方法在Room-2-Room(R2R)与Room-4-Room(R4R)数据集上优于判别式方法,尤其在未见环境中。我们进一步表明,生成式与判别式策略的结合在R2R数据集上取得了接近最优(state-of-the-art)的结果,证明生成式与判别式策略捕捉了VLN的不同方面。

关键词

引用

@article{arxiv.2009.07783,
  title  = {Generative Language-Grounded Policy in Vision-and-Language Navigation with Bayes' Rule},
  author = {Shuhei Kurita and Kyunghyun Cho},
  journal= {arXiv preprint arXiv:2009.07783},
  year   = {2020}
}

备注

13 pages, 8 figures