评估生成文本的事实准确性
计算与语言
2021-05-27 v2
摘要
我们提出了一种基于模型的度量来估计生成文本的事实准确性,它是对 ROUGE(面向召回的摘要评估替补)和 BLEU(双语评估替补)等典型评分方案的补充。我们引入并发布了一个基于 Wikipedia 和 Wikidata 的新大规模数据集,用于训练关系分类器和端到端事实抽取模型。结果表明端到端模型能够从包含整页文本的数据集中抽取出完整的事实集合。然后我们分析了多个在 Wikipedia 文本摘要任务上估计事实准确性的模型,并通过开展人工评估研究展示了它们相对于 ROUGE 及其他无模型变体的有效性。
引用
@article{arxiv.1905.13322,
title = {Assessing The Factual Accuracy of Generated Text},
author = {Ben Goodrich and Vinay Rao and Mohammad Saleh and Peter J Liu},
journal= {arXiv preprint arXiv:1905.13322},
year = {2021}
}