PaCoST:用于大型语言模型基准测试污染检测的配对置信度显著性检验
计算与语言
2025-03-19 v2 人工智能
摘要
大型语言模型 (LLMs) 已知会在庞大的训练数据中进行训练,这些数据可能无意或有意地包含来自常用基准测试的数据。这一包含可能导致模型在模型排行榜上获得作弊性的高分,但在实际应用中表现令人失望。为了解决这一基准测试污染问题,我们首先提出了一组实际污染检测方法应遵循的要求。遵循这些提出的要求后,我们引入 PaCoST,即 Paired Confidence Significance Testing,用于有效检测大型语言模型中的基准测试污染。我们的方法为每段数据构建一个具有相同分布的对等数据,并对相应的置信度进行统计分析,以检验模型在原始基准测试下的置信度是否显著更高。我们验证了 PaCoST 的有效性,并将其应用于流行的开源模型和基准测试。我们发现,我们测试的几乎所有模型和基准测试都有一定程度的可疑污染。我们最终呼吁新的大型语言模型评估方法。
引用
@article{arxiv.2406.18326,
title = {PaCoST: Paired Confidence Significance Testing for Benchmark Contamination Detection in Large Language Models},
author = {Huixuan Zhang and Yun Lin and Xiaojun Wan},
journal= {arXiv preprint arXiv:2406.18326},
year = {2025}
}
备注
Accepted by EMNLP 2024 Findings