评估评估者:可读性指标是衡量可读性的良好标准吗?
计算与语言
2025-08-27 v1
摘要
简明语言摘要(PLS)旨在将复杂文档提炼为面向非专业受众的易懂摘要。本文对PLS文献进行了全面综述,并发现当前可读性评估的标准做法是使用传统可读性指标,例如Flesch-Kincaid年级水平(FKGL)。然而,尽管这些指标在其他领域已被证明有效,但在PLS中尚未与人类可读性判断进行比较。我们评估了8种可读性指标,结果表明大多数指标与人类判断的相关性较差,包括最流行的指标FKGL。我们随后表明,语言模型(LMs)是更好的可读性评判者,表现最佳的模型与人类判断的皮尔逊相关系数达到0.56。将分析扩展到包含面向非专业受众摘要的PLS数据集后,我们发现语言模型能更好地捕捉更深层次的可读性度量,例如所需的背景知识,并得出与传统指标不同的结论。基于这些发现,我们为评估简明语言摘要的最佳实践提供了建议。我们公开了分析代码和调研数据。
引用
@article{arxiv.2508.19221,
title = {Evaluating the Evaluators: Are readability metrics good measures of readability?},
author = {Isabel Cachola and Daniel Khashabi and Mark Dredze},
journal= {arXiv preprint arXiv:2508.19221},
year = {2025}
}