QuestEval:摘要需要基于事实的评估
计算与语言
2021-04-12 v2
摘要
摘要评估仍是一个开放的研究问题:当前的指标(如 ROUGE)已知存在局限,且与人类判断相关性较差。为缓解该问题,近期工作提出了依赖问答模型来评估摘要是否包含源文档中所有相关信息的评估指标。尽管有前景,所提出的方法迄今未能比 ROUGE 更好地与人类判断相关。在本文中,我们扩展先前方法并提出一个名为 QuestEval 的统一框架。与 ROUGE 或 BERTScore 等已有指标不同,QuestEval 不需要任何真实参考。尽管如此,正如我们所报告的广泛实验所示,QuestEval 在四个评估维度(一致性、连贯性、流畅性和相关性)上大幅改善了与人类判断的相关性。
引用
@article{arxiv.2103.12693,
title = {QuestEval: Summarization Asks for Fact-based Evaluation},
author = {Thomas Scialom and Paul-Alexis Dray and Patrick Gallinari and Sylvain Lamprier and Benjamin Piwowarski and Jacopo Staiano and Alex Wang},
journal= {arXiv preprint arXiv:2103.12693},
year = {2021}
}
备注
project page: https://github.com/recitalAI/QuestEval