中文

推理时去污:重用泄漏基准进行大语言模型评估

计算与语言 2024-06-25 v2

摘要

大语言模型(LLM)的训练过程常常涉及不同程度的测试数据污染。尽管当前的 LLM 在各种基准测试中正不断取得更好的成绩,但在实际应用中其表现并不总是与基准结果相符。基准数据泄漏会阻止准确评估 LLM 的真实性能。然而,构建新的基准测试成本高昂、耗时耗力,且仍存在泄漏风险。因此,本文提出了一个问题:我们能否重用这些泄漏的基准测试进行 LLM 评估?我们提出了推理时去污(Inference-Time Decontamination,ITD)方法,以解决此问题,通过检测和重写被泄漏的样本而不改变其难度。ITD 可以减轻由于记忆泄漏基准而导致的性能膨胀。我们的概念验证实验表明,ITD 在 GSM8K 上的虚假准确率降低了 22.9%,在 MMLU 上的降低幅度为 19.0%。在 MMLU 上,使用推理时去汤,Phi3 和 Mistral 的结果分别下降 6.7% 和 3.6%。我们希望 ITD 能为大语言模型提供更真实的评估结果。

关键词

引用

@article{arxiv.2406.13990,
  title  = {Inference-Time Decontamination: Reusing Leaked Benchmarks for Large Language Model Evaluation},
  author = {Qin Zhu and Qingyuan Cheng and Runyu Peng and Xiaonan Li and Tengxiao Liu and Ru Peng and Xipeng Qiu and Xuanjing Huang},
  journal= {arXiv preprint arXiv:2406.13990},
  year   = {2024}
}