忽视人间温度:LLM 基于摘要评估中的重叠偏差
计算与语言
2026-02-10 v1
摘要
大型语言模型(LLM)评判官常与传统算法指标一起用于摘要等任务,因为它们更好地捕捉语义信息、在推理方面更具鲁棒性,并且对改写更具鲁棒性。然而,LLM 评判官对长度和顺序等方面存在偏差,并且易受各种对抗输入提示的攻击。虽然近期研究已探讨这些偏差,但很少有研究从更细粒度层面分析这些偏差与 well-defined overlap 指标之间的关系。本文我们提供了 LLM 评判官偏差分析,作为与人类编写响应之间重叠度的函数,用于摘要领域。我们测试了 9 个最新 LLM,参数规模从 10 亿到 120 亿不等,包括 Gemma 3 和 LLaMA 3 的变体。我们发现,LLM 评判官越来越倾向于选择由其他 LLM 生成的摘要而非人类编写的摘要,这与被评判摘要与人类响应之间的相似度(以 ROUGE 和 BLEU 测量)减小的程度成正比,这一模式延伸至除一款模型外的所有测试模型,且无论模型自身是否持有位置偏差均存在。此外,我们发现模型即使在面对有限重叠的摘要时也难以进行判断,这表明 LLM 作为摘要领域的评判官应依赖超出简单比较之外的技术。
引用
@article{arxiv.2602.07673,
title = {Blind to the Human Touch: Overlap Bias in LLM-Based Summary Evaluation},
author = {Jiangnan Fang and Cheng-Tse Liu and Hanieh Deilamsalehy and Nesreen K. Ahmed and Puneet Mathur and Nedim Lipka and Franck Dernoncourt and Ryan A. Rossi},
journal= {arXiv preprint arXiv:2602.07673},
year = {2026}
}