PerSEval:评估文本摘要器中的个人化程度
计算与语言
2024-10-28 v2 机器学习
摘要
个性化摘要模型迎合个体对重要性的主观理解,此理解体现在其阅读历史和当前注意主题之中。现有的个性化文本摘要模型主要基于准确度措施(如 BLEU、ROUGE、METEOR)进行评估。然而,近期研究指出准确度措施不足以评估这些模型个人化程度,提出了 EGISES,即首个用于评估个性化文本摘要的度量标准。据此建议准确度应独立进行评估。本文我们质疑是否需要准确度排行榜,指出依赖准确度聚合结果可能导致误导性结论。为支持此观点,我们深入分析 EGISES,理论和实证表明其衡量的是响应程度——这是个人化程度必需但非充分条件。我们随后提出 PerSEval,一种满足充分条件的新度量。基于在 PENS 数据集上对十个最新流行摘要模型进行基准测试,我们实证证明:(i) PerSEval 与人类判断相关性可靠(Pearson's r = 0.73;Spearman's = 0.62;Kendall's = 0.42),(ii) PerSEval 拥有高秩稳定性,(iii) PerSEval 作为秩衡量标准不等同于 EGISES 排序,(iv) PerSEval 可作为无需任何聚合排名的独立秩衡量。
引用
@article{arxiv.2407.00453,
title = {PerSEval: Assessing Personalization in Text Summarizers},
author = {Sourish Dasgupta and Ankush Chander and Parth Borad and Isha Motiyani and Tanmoy Chakraborty},
journal= {arXiv preprint arXiv:2407.00453},
year = {2024}
}
备注
Accepted in Transactions on Machine Learning Research (TMLR)