中文

大语言模型在评估中作弊的程度如何?基于一次性密码本框架的过估计基准测试

计算与语言 2026-05-26 v2 密码学与安全

摘要

大语言模型(LLMs)评估中的过估计已成为日益受到关注的问题。由于公开基准的污染或模型训练的不平衡,LLMs 可能在公开基准上有意或无意地取得不真实的评估结果,这导致 LLM 之间的不公平比较,并削弱对其真实能力的评估。现有的基准试图通过永久保密测试用例、通过人工评估缓解污染,或反复收集与构建新样本来解决这些问题。然而,这些方法无法同时保证可复现性、透明性与高效率。此外,当前 LLM 中过估计的程度仍未被量化。为解决这些问题,我们提出了 ArxivRoll,一个受密码学中一次性密码本加密启发的动态评估框架。ArxivRoll 包含两个关键组件: i) SCP(排序、完形填空与预测),一个用于生成私有测试用例的自动化生成器;以及 ii) Rugged Scores (RS),用于衡量公开基准污染与训练偏差比例的指标。利用 SCP,ArxivRoll 每六个月使用 ArXiv 上的最新文章构建一个新基准,并将其用于对 LLM 性能的一次性评估。大量实验证明了我们基准的高质量,并提供了对当前 LLM 的系统评估。源代码可在 https://github.com/liangzid/ArxivRoll/ 获取。

关键词

引用

@article{arxiv.2507.19219,
  title  = {How Much Do Large Language Model Cheat on Evaluation? Benchmarking Overestimation under the One-Time-Pad-Based Framework},
  author = {Zi Liang and Liantong Yu and Shiyu Zhang and Qingqing Ye and Haibo Hu},
  journal= {arXiv preprint arXiv:2507.19219},
  year   = {2026}
}

备注

This paper has been accepted by AAAI 2026. We update it for adding new evaluation results for ArxivRollBench-2025a and ArxivRollBench-2026a, with the evaluation of timly models like DeepSeekV4Pro, GPT-5.5, Claude-Opus-4.7, and so on. Source code: https://github.com/liangzid/ArxivRoll/ Online Leaderboard Website: https://arxivroll.moreoverai.com/