中文

大语言模型自评估与跨评估中的标签引发偏差量化

计算与语言 2025-10-13 v3 人工智能

摘要

大语言模型(LLM)正日益被部署作为文本质量评估器,但其判断的有效性仍未得到充分探讨。本研究调查了跨三个主流大语言模型(ChatGPT、Gemini和Claude)进行自评估和跨模型评估中系统性偏差。我们设计了一个受控实验,其中各模型撰写的博客文章将被所有三个模型在四种标签条件下进行评估:无归属、真实归属以及两种虚假归属情形。评估采用整体偏好投票和细粒度质量评分,分别从三个维度(连贯性、信息性和简洁性)进行评分,所有分数均归一化为百分比,以便直接比较。我们的发现揭示了模型判断之间的显著不对称性:“Claude”标签始终提升评分,无论实际作者为何;而“Gemini”标签则系统性地压低评分。虚假归属经常会颠覆偏好排名,在投票结果中导致最高可达50个百分点的变动,在质量评分中导致最高可达12个百分点的变动。值得注意的是,Gemini在真实标签下表现出严重的自我贬低,而Claude则显示出加剧的自我偏好。这些结果表明,感知到的模型身份可以显著扭曲高层判断和细粒度质量评估的结果,这一现象独立于内容质量。我们的发现挑战了LLM作为裁判范式的可靠性,并凸显了确保自动文本评估和LLM基准测试公平性和有效性的在盲评估协议和多模型验证框架的关键需求。

关键词

引用

@article{arxiv.2508.21164,
  title  = {Quantifying Label-Induced Bias in Large Language Model Self- and Cross-Evaluations},
  author = {Muskan Saraf and Sajjad Rezvani Boroujeni and Justin Beaudry and Hossein Abedi and Tom Bush},
  journal= {arXiv preprint arXiv:2508.21164},
  year   = {2025}
}