中文

论推理模型中基准污染检测的脆弱性

密码学与安全 2026-03-03 v2 人工智能 机器学习

摘要

大型推理模型(LRM)的排行榜已将评估转变为一场竞赛,激励开发者直接在基准测试套件上进行优化。获得更高排名的一条捷径是将评估基准纳入训练数据,从而产生虚高的性能,这被称为基准污染。令人惊讶的是,我们的研究发现,规避 LRM 的污染检测异常容易。我们关注实际中可能发生污染的两种场景:(I) 当基础模型通过 SFT 和 RL 演变为 LRM 时,我们发现 SFT 期间的污染最初可以通过污染检测方法识别。然而,即使是短暂的 GRPO 训练也能显著掩盖大多数检测方法所依赖的污染信号。进一步的实证实验和理论分析表明,PPO 风格的重要性采样和截断目标是这种检测掩盖的根本原因,表明一大类 RL 方法可能固有地具备类似的掩盖能力;(II) 当带有 CoT 的 SFT 污染作为最终阶段应用于高级 LRM 时,大多数污染检测方法的表现接近于随机猜测。在未接触非成员样本的情况下,被污染的 LRM 在响应那些与训练集分布相似的未见样本时仍会具有更高的置信度,从而规避现有的基于记忆的检测方法。综合来看,我们的发现揭示了 LRM 评估的独特脆弱性:模型开发者可以轻易地污染 LRM 以获得虚高的排行榜性能,同时留下极少的污染痕迹,从而严重破坏评估的公平性并威胁公共排行榜的完整性。这凸显了针对 LRM 量身定制先进污染检测方法和可信评估协议的迫切需求。

关键词

引用

@article{arxiv.2510.02386,
  title  = {On The Fragility of Benchmark Contamination Detection in Reasoning Models},
  author = {Han Wang and Haoyu Li and Brian Ko and Huan Zhang},
  journal= {arXiv preprint arXiv:2510.02386},
  year   = {2026}
}

备注

Accepted by ICLR 2026