LLM评估报告的毒酒杯
软件工程
2026-07-08 v1
摘要
大型语言模型越来越多地被用于评估和支持软件工程任务,然而这些评估的有效性常常因基准测试实例在预训练期间是否被看到的不确定性而受到损害。这可能导致数据污染,从而可能夸大性能并导致关于模型能力的误导性结论。尽管如此,许多现代模型的训练语料库仅部分公开,使得直接去污染不可行。这就产生了对实用方法的需求,这些方法可以在不访问完整训练语料库的情况下检测大型语言模型先前对训练数据的暴露。为了应对这一挑战,我们组织了第一届毒酒杯LLM评估竞赛,与FSE-AIWare 2026竞赛轨道联合举办。该竞赛将污染检测框定为源代码上的白盒成员推断任务,并为参与者提供精选数据集、目标模型、基线攻击以及最终在保留模型和数据集上的评估。这种设计鼓励方法超越表面的数据集伪影和单一训练设置进行泛化。本文报告了竞赛的设置和结果。更广泛地说,该竞赛旨在促进围绕软件工程可信LLM评估的社区发展。
引用
@article{arxiv.2607.07481,
title = {The Poisoned Chalice of LLM Evaluation Report},
author = {Jonathan Katzy and Ali Al-Kaswan and Razvan Mihai Popescu and Zhou Yang},
journal= {arXiv preprint arXiv:2607.07481},
year = {2026}
}
备注
Report of the competition hosted at FSE 2026