Q^2:通过问题生成与问答评估知识 grounded 对话中的事实一致性
计算与语言
2021-09-10 v2
摘要
用于对话的神经知识grounded生成模型常产生与其所依赖知识事实不一致的内容,使其不可靠并限制了适用性。受近期摘要事实一致性评估工作的启发,我们提出一种利用自动问题生成与问答评估知识grounded对话事实一致性的自动度量。我们的度量记为,使用自然语言推理(NLI)比较答案跨度,而非像先前工作那样基于词符匹配。为促进恰当评估,我们为Wizard-of-Wikipedia数据集策划了一个新颖的对话系统输出数据集,并人工标注了事实一致性。我们使用该数据集及另外两个数据集对与其他度量进行了彻底的元评估,其始终显示出与人工判断更高的相关性。
引用
@article{arxiv.2104.08202,
title = {$Q^{2}$: Evaluating Factual Consistency in Knowledge-Grounded Dialogues via Question Generation and Question Answering},
author = {Or Honovich and Leshem Choshen and Roee Aharoni and Ella Neeman and Idan Szpektor and Omri Abend},
journal= {arXiv preprint arXiv:2104.08202},
year = {2021}
}
备注
Accepted to EMNLP 2021