真实世界的摘要:当评估触及极限
计算与语言
2025-07-16 v1
摘要
我们考察了在酒店亮点情境下对输入数据忠实度的评估问题:这些是简短的、由大语言模型生成的摘要,捕捉住惟一的住宿特征。通过人类评估活动,包括类别错误评估和片段级标注,我们比较了传统指标、可训练方法和大语言模型评判方法。我们的发现表明,诸如词重叠等简单指标与人类判断(斯佩森相关系数为0.63) surprisingly well 地相关,往往在应用于域外数据时超越更复杂的方法。我们进一步证明,尽管大语言模型能够生成高质量的亮点,但它们在评估方面不可靠,因为它们倾向于严重低或高标注。我们的分析表明,错误信息和不可核查的信息在真实商业影响中构成最大风险。我们也指出了众包评估的挑战。
引用
@article{arxiv.2507.11508,
title = {Real-World Summarization: When Evaluation Reaches Its Limits},
author = {Patrícia Schmidtová and Ondřej Dušek and Saad Mahamood},
journal= {arXiv preprint arXiv:2507.11508},
year = {2025}
}