LLMEval-Fair:大型语言模型鲁棒性与公平性评估的大规模纵向研究
计算与语言
2026-04-16 v7
摘要
现有大型语言模型(LLM)在静态基准测试上的评估易受数据污染和排行榜过拟合的威胁,这两者是掩盖真实模型能力的关键问题。为此,我们引入了 LLMEval-Fair,一个用于动态评估大型语言模型的框架。LLMEval-Fair 基于一套拥有 22 万道研究生水平问题的专有数据库,动态抽取每次评估中未出现的测试集。其自动化管道通过抗污染的数据策展、一种新型反作弊架构以及达到 90% 同人类专家一致性的校准 LLM 评判流程,确保了评估的可靠性,同时配备了用于公平比较的相对排名系统。一项为期 30 个月、涵盖近 60 个领先模型的纵向研究揭示了知识记忆存在的性能瓶颈,并暴露出静态基准测试难以检测的数据污染漏洞。该框架在排名稳定性和一致性方面表现出卓越的鲁棒性,为动态评估范式提供了有力的实证依据。LLMEval-Fair 提供了一种稳健且可信的方法,用于评估超越排行榜分数的大型语言模型的真实能力,推动了更可信的评估标准的发展。我们的代码和数据已公开发布于 https://github.com/llmeval/LLMEval-Fair。
引用
@article{arxiv.2508.05452,
title = {LLMEval-Fair: A Large-Scale Longitudinal Study on Robust and Fair Evaluation of Large Language Models},
author = {Ming Zhang and Yujiong Shen and Jingyi Deng and Yuhui Wang and Huayu Sha and Kexin Tan and Qiyuan Peng and Yue Zhang and Junzhe Wang and Shichun Liu and Yueyuan Huang and Jingqi Tong and Changhao Jiang and Yilong Wu and Zhihao Zhang and Mingqi Wu and Mingxu Chai and Zhiheng Xi and Shihan Dou and Tao Gui and Qi Zhang and Xuanjing Huang},
journal= {arXiv preprint arXiv:2508.05452},
year = {2026}
}