中文

VANiLLa:大规模自然语言口语化答案生成

计算与语言 2021-05-25 v1

摘要

近年来,知识图谱问答(KGQA)领域取得了显著进展。尽管有诸多值得注意的进展,当前的 KGQA 数据集仅将形式化查询的直接输出结果作为答案,而非结合问题语境的完整句子。为获得与问题词汇一致的通顺答案句,通常采用基于模板的口语化方法以更好地表征答案,而这又需要大量专家介入。因此为机器学习方法留下了空间;然而,赋能该领域机器学习模型的数据集十分匮乏。为此,我们提供了 VANiLLa 数据集,旨在通过提供自然语言句子形式的答案来缩小这一差距。该数据集中的答案句在句法与语义上更接近问题而非三元组事实。我们的数据集包含超过 10 万道改编自 CSQA 与 SimpleQuestionsWikidata 数据集、并利用半自动框架生成的简单问题。我们还给出了将本数据集训练于改编自当前最先进自然语言生成(NLG)架构的多个基线模型上的结果。我们相信该数据集将助力研究者聚焦于寻找适用于答案口语化的方法与架构。

关键词

引用

@article{arxiv.2105.11407,
  title  = {VANiLLa : Verbalized Answers in Natural Language at Large Scale},
  author = {Debanjali Biswas and Mohnish Dubey and Md Rashad Al Hasan Rony and Jens Lehmann},
  journal= {arXiv preprint arXiv:2105.11407},
  year   = {2021}
}