中文

作为自恋评估者的大语言模型:当自我偏好抬高评估分数

计算与语言 2024-06-10 v4

摘要

生成文本内容的自动评估在自然语言处理(NLP)领域始终是一项持续存在的挑战。鉴于现代语言模型(LMs)在多样 NLP 任务中的卓越能力,利用这些模型创建创新性评估指标以自动评价生成任务的做法日益增多。本文探讨一个关键问题:由语言模型驱动的评估指标是否固有地表现出偏爱同一底层语言模型所生成文本的偏差?具体而言,我们评估 prominent 的基于 LM 的评估指标(如 BARTScore、T5Score 与 GPTScore)在摘要任务中是否对其各自底层 LM 存在偏好偏差。我们的发现揭示了一种潜在偏差,尤其当此类评估指标以无参考方式使用且未利用黄金摘要时更为显著。这些结果凸显生成式评估模型给出的评判可能受文本质量以外因素的影响,表明未来有必要开发更可靠的评估协议。

关键词

引用

@article{arxiv.2311.09766,
  title  = {LLMs as Narcissistic Evaluators: When Ego Inflates Evaluation Scores},
  author = {Yiqi Liu and Nafise Sadat Moosavi and Chenghua Lin},
  journal= {arXiv preprint arXiv:2311.09766},
  year   = {2024}
}