中文

大语言模型评估中的累积消息效应

人工智能 2026-05-26 v2 计算与语言 机器学习

摘要

大型语言模型常被用作自动评估工具:审查代码、审核内容或对输出进行评分,往往一次对话中会有许多项目经过。我们询问先前的对话历史是否会偏向后续判断,这种效应我们称为累积消息效应 (AMEL)。我们对 75,898 次 API 调用(涵盖 11 个模型,来自 4 个提供商:OpenAI、Anthropic、Google 以及四个开源模型)进行测试,呈现相同的测试项目是孤立呈现还是跟随被积极或消极评估饱和的历史。在消极历史中,模型倾向于向对话的主导极性移动(d = -0.17, p < 10^-46)。该效应集中在基线时模型真正不确定的项目上(高熵项目 d = -0.34,而基线确定性时 d = -0.15)。偏差不会随上下文长度增长:5 个 prior 轮和 50 个 prior 轮产生相同的位移(Spearman |r| < 0.01; OLS slope p = 0.80)。且存在负性不对称:成对地针对每个项目,消极历史诱导的偏差是消极的 1.62 倍(t = 13.46, p < 10^-39, n = 2,481)。规模化有所帮助,但并未解决(Anthropic:Haiku -0.22 降至 Opus -0.17;OpenAI:Nano -0.34 降至 GPT-5.2 -0.17)。三项后续研究缩小了机制。token 概率分布连续移动,而非在阈值处。负性不对称具有 token 级别和语义成分,尽管在我们的样本规模下归因于哪一种仍具探索性。位置不重要:5 个偏置的轮次即使出现在 50 轮历史中的任何位置,都产生相同的位移。评估管道的最简单修复方法是为每个项目提供新的上下文;当不可避免地进行批量处理时,平衡历史有助于缓解。

关键词

引用

@article{arxiv.2605.22714,
  title  = {AMEL: Accumulated Message Effects on LLM Judgments},
  author = {Sid-Ali Temkit},
  journal= {arXiv preprint arXiv:2605.22714},
  year   = {2026}
}

备注

19 pages, 14 figures, 6 tables. Single author. Code, data (75,898 deduplicated API responses), and analysis pipeline at https://github.com/chutapp/amel