基于视觉接地的前提蕴含句生成
计算与语言
2019-09-24 v1 人工智能
神经与进化计算
摘要
自然语言推理(NLI)是确定前提与假设之间语义关系的任务。本文关注多模态设定下从前提生成假设,即以图像和/或其描述(前提)作为输入来生成句子(假设)。本文的主要目标是(a)探究将 NLI 框定为生成任务是否合理;以及(b)考量将文本前提扎根于视觉信息在多大程度上有益于生成。我们比较了不同的神经架构,通过自动与人工评估表明蕴含句确实可以成功生成。我们还表明,多模态模型在此任务上优于单模态模型,尽管优势有限。
引用
@article{arxiv.1909.09788,
title = {Visuallly Grounded Generation of Entailments from Premises},
author = {Somaye Jafaritazehjani and Albert Gatt and Marc Tanti},
journal= {arXiv preprint arXiv:1909.09788},
year = {2019}
}
备注
Proceedings of the 12th International Conference on Natural Language Generation (INLG 2019), 11 pages, 5 figures