中文

Q^2:通过问题生成与问答评估知识 grounded 对话中的事实一致性

计算与语言 2021-09-10 v2

摘要

用于对话的神经知识grounded生成模型常产生与其所依赖知识事实不一致的内容,使其不可靠并限制了适用性。受近期摘要事实一致性评估工作的启发,我们提出一种利用自动问题生成与问答评估知识grounded对话事实一致性的自动度量。我们的度量记为Q2Q^2,使用自然语言推理(NLI)比较答案跨度,而非像先前工作那样基于词符匹配。为促进恰当评估,我们为Wizard-of-Wikipedia数据集策划了一个新颖的对话系统输出数据集,并人工标注了事实一致性。我们使用该数据集及另外两个数据集对Q2Q^2与其他度量进行了彻底的元评估,其始终显示出与人工判断更高的相关性。

关键词

引用

@article{arxiv.2104.08202,
  title  = {$Q^{2}$: Evaluating Factual Consistency in Knowledge-Grounded Dialogues via Question Generation and Question Answering},
  author = {Or Honovich and Leshem Choshen and Roee Aharoni and Ella Neeman and Idan Szpektor and Omri Abend},
  journal= {arXiv preprint arXiv:2104.08202},
  year   = {2021}
}

备注

Accepted to EMNLP 2021