重新思考句子简化中的自动评估
计算与语言
2021-04-19 v2
摘要
自动评估在自然语言生成中仍是一个开放的研究问题。在句子简化任务中,这尤其具有挑战性:该任务本质上要求用含义相同但更简单的词替换复杂词,这限制了 BLEU 等基于 n-gram 的度量标准的有效性。随着 NLG 近期进展,新指标被提出,例如用于机器翻译的 BERTScore。在摘要任务中,QuestEval 指标提出通过相互提问来自动比较两个文本。本文中,我们首先提出对 QuestEval 的简单修改,使其能处理句子简化。随后我们广泛评估了包括近期 BERTScore 与 QuestEval 在内的若干指标相对于人类判断的相关性,并表明后者取得了 state-of-the-art 相关性,优于 BLEU 和 SARI 等标准指标。更重要的是,我们还表明对所有指标而言,相关性的很大一部分实际上是虚假的。为深入探究此现象,我们发布了一个新的人工评估简化语料,该语料并非由系统生成,而是由人类撰写。这使我们能够去除虚假相关性并得出与原始结论截然不同的结论,从而更好地理解这些指标。特别地,我们对大多数传统指标极低的相关性提出担忧。我们的结果表明,意义保持(Meaning Preservation)唯一显著的度量是我们对 QuestEval 的改造。
引用
@article{arxiv.2104.07560,
title = {Rethinking Automatic Evaluation in Sentence Simplification},
author = {Thomas Scialom and Louis Martin and Jacopo Staiano and Éric Villemonte de la Clergerie and Benoît Sagot},
journal= {arXiv preprint arXiv:2104.07560},
year = {2021}
}
备注
updated affiliation and link to data