APPLS:面向简明语言摘要的评估指标评测
计算与语言
2025-04-03 v4
摘要
尽管简明语言摘要(PLS)模型已取得显著进展,其评估仍具挑战。PLS 缺乏专门的评估指标,且由于涉及独特的转换(如添加背景解释、去除术语),文本生成评估指标的适用性尚不明确。为解决这些问题,我们的研究引入了细粒度元评估测试平台 APPLS,用于评估 PLS 的指标。我们从已有工作中识别出 PLS 的四个标准——信息性、简化性、连贯性和忠实性——并定义了与这些标准对应的扰动集,敏感的指标应能够检测这些扰动。我们将这些扰动应用于两个 PLS 数据集的抽取式假设以构建测试平台。使用 APPLS,我们评估了 14 个指标的性能,包括自动化分数、词汇特征和基于 LLM prompt 的评估。分析表明,尽管部分当前指标对特定标准敏感,但尚无单一方法能同时捕捉全部四个标准。因此我们建议采用一组自动化指标来覆盖所有相关标准下的 PLS 质量。本工作贡献了首个 PLS 元评估测试平台及对现有指标的综合评估。APPLS 及评估代码见 https://github.com/LinguisticAnomalies/APPLS。
引用
@article{arxiv.2305.14341,
title = {APPLS: Evaluating Evaluation Metrics for Plain Language Summarization},
author = {Yue Guo and Tal August and Gondy Leroy and Trevor Cohen and Lucy Lu Wang},
journal= {arXiv preprint arXiv:2305.14341},
year = {2025}
}
备注
This paper has been accepted by 2024 EMNLP main. Please cite the EMNLP version