当 LLM 进行基准测试时:解构自我偏置中的自动化评估
计算与语言
2026-05-27 v2 人工智能
摘要
随着大语言模型(LLM)迅速饱和现有基准测试,一种新型的自动化基准测试方法——LLM 作为基准测试(LLM-as-a-benchmark)——即模型生成测试输入(LLM-as-a-testset)并评估输出(LLM-as-an-evaluator),正受到越来越多的关注,因其相较于人工标注具有成本优势。我们展示了这一范式存在根本性问题:LLM 生成的基准测试系统性地偏向于创建它们的模型。以机器翻译为主要测试环境,我们发现自我偏置源自两个可加因素:LLM 作为测试集与 LLM 作为评估器,二者组合会放大该效应。关键在于,即便在测试数据生成时施加了明确的多样性控制,每个模型隐含的风格倾向仍会产生均质且模型特定的输出,从而人为提升其自身得分。增加源文本的多样性、运用我们提出的多样性度量指标,可部分缓解这一偏置。自我偏置的影响如此显著,以至于每个模型都会将自身排名置于首位,置换了基于同行共识的排序顺序。我们进一步确认,该现象也适用于 Chatbot Arena 任务中开放式生成。
引用
@article{arxiv.2509.26600,
title = {When LLMs Benchmark Themselves: Deconstructing Self-Bias in Automated Evaluation},
author = {Wenda Xu and Sweta Agrawal and Vilém Zouhar and Markus Freitag and Daniel Deutsch},
journal= {arXiv preprint arXiv:2509.26600},
year = {2026}
}