中文

PaCoST:用于大型语言模型基准测试污染检测的配对置信度显著性检验

计算与语言 2025-03-19 v2 人工智能

摘要

大型语言模型 (LLMs) 已知会在庞大的训练数据中进行训练,这些数据可能无意或有意地包含来自常用基准测试的数据。这一包含可能导致模型在模型排行榜上获得作弊性的高分,但在实际应用中表现令人失望。为了解决这一基准测试污染问题,我们首先提出了一组实际污染检测方法应遵循的要求。遵循这些提出的要求后,我们引入 PaCoST,即 Paired Confidence Significance Testing,用于有效检测大型语言模型中的基准测试污染。我们的方法为每段数据构建一个具有相同分布的对等数据,并对相应的置信度进行统计分析,以检验模型在原始基准测试下的置信度是否显著更高。我们验证了 PaCoST 的有效性,并将其应用于流行的开源模型和基准测试。我们发现,我们测试的几乎所有模型和基准测试都有一定程度的可疑污染。我们最终呼吁新的大型语言模型评估方法。

关键词

引用

@article{arxiv.2406.18326,
  title  = {PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models},
  author = {Huixuan Zhang and Yun Lin and Xiaojun Wan},
  journal= {arXiv preprint arXiv:2406.18326},
  year   = {2025}
}

备注

Accepted by EMNLP 2024 Findings