来自预训练语言模型的困惑度在文本质量评估中不可靠
计算与语言
2023-03-16 v2 人工智能
摘要
近来,大量工作利用困惑度(PPL)来评估生成文本的质量。它们假设若 PPL 值越小,则待评估文本的质量(即流畅度)越好。然而,我们发现 PPL 裁判并不合格,它无法公平地评估生成文本,原因如下:(i)短文本的 PPL 大于长文本,这违背常识;(ii)重复的文本片段会损害 PPL 的性能;(iii)标点符号会严重影响 PPL 的性能。实验表明,PPL 在评估给定文本质量时是不可靠的。最后,我们讨论了使用语言模型评估文本质量的关键问题。
引用
@article{arxiv.2210.05892,
title = {Perplexity from PLM Is Unreliable for Evaluating Text Quality},
author = {Yequan Wang and Jiawen Deng and Aixin Sun and Xuying Meng},
journal= {arXiv preprint arXiv:2210.05892},
year = {2023}
}