中文

基于视觉接地的前提蕴含句生成

计算与语言 2019-09-24 v1 人工智能 神经与进化计算

摘要

自然语言推理(NLI)是确定前提与假设之间语义关系的任务。本文关注多模态设定下从前提生成假设,即以图像和/或其描述(前提)作为输入来生成句子(假设)。本文的主要目标是(a)探究将 NLI 框定为生成任务是否合理;以及(b)考量将文本前提扎根于视觉信息在多大程度上有益于生成。我们比较了不同的神经架构,通过自动与人工评估表明蕴含句确实可以成功生成。我们还表明,多模态模型在此任务上优于单模态模型,尽管优势有限。

关键词

引用

@article{arxiv.1909.09788,
  title  = {Visuallly Grounded Generation of Entailments from Premises},
  author = {Somaye Jafaritazehjani and Albert Gatt and Marc Tanti},
  journal= {arXiv preprint arXiv:1909.09788},
  year   = {2019}
}

备注

Proceedings of the 12th International Conference on Natural Language Generation (INLG 2019), 11 pages, 5 figures