中文

罗马建于 1776 年:知识 grounded 回复生成中事实正确性的案例研究

计算与语言 2022-10-06 v2 人工智能

摘要

近来神经回复生成模型利用大型预训练 transformer 模型和知识片段来生成相关且信息丰富的回复。然而,这并不能保证生成的回复在事实上正确。本文中,我们考察知识 grounded 神经回复生成模型中的事实正确性。我们提出一种人工标注设置,以识别三种不同回复类型:相对于输入知识事实一致的回复、包含幻觉知识的回复,以及不可验证的闲聊风格回复。我们使用该设置标注由不同最先进模型、知识片段和解码策略生成的回复。此外,为促进事实一致性检测器的开发,我们自动创建了一个称为 Conv-FEVER 的新语料库,其改编自 Wizard of Wikipedia 数据集,包含事实一致和不一致的回复。我们通过对人类标注数据的评估表明,在此数据上训练的模型在检测相对于所提供知识的事实不一致回复方面表现相当好,从而展示了 Conv-FEVER 数据集的益处。我们将发布 Conv-FEVER 数据集与人类标注回复。

关键词

引用

@article{arxiv.2110.05456,
  title  = {Rome was built in 1776: A Case Study on Factual Correctness in Knowledge-Grounded Response Generation},
  author = {Sashank Santhanam and Behnam Hedayatnia and Spandana Gella and Aishwarya Padmakumar and Seokhwan Kim and Yang Liu and Dilek Hakkani-Tur},
  journal= {arXiv preprint arXiv:2110.05456},
  year   = {2022}
}