MMLU-CF:无污染的多任务语言理解基准
计算与语言
2025-06-30 v1 人工智能
机器学习
性能
摘要
类似大规模多任务语言理解(MMLU)的多选题数据集广泛用于评估大语言模型(LLM)的常识、理解和问题解决能力。然而,开源本质和LLM训练数据的广泛来源不可避免地导致基准污染,导致不可靠的评估结果。为缓解此问题,我们提出了一个无污染且更具挑战性的多选题基准,称为MMLU-CF。该基准通过规避意外和恶意数据泄露,重新评估LLM对世界知识的理解。为避免意外数据泄露,我们来自更广泛的领域,并设计了三个去污规则。为防止恶意数据泄露,我们将基准划分为类似难度和学科分布的验证集和测试集。测试集保持闭源以确保可靠结果,而验证集公开可用以促进透明度并便于独立验证。我们对主流LLM进行评估,发现强大的GPT-4o在测试集上仅获得5-shot得分73.4%和0-shot得分71.9%,这表明我们的方法在创建更严谨且无污染的评估标准方面有效。
引用
@article{arxiv.2412.15194,
title = {MMLU-CF: A Contamination-free Multi-task Language Understanding Benchmark},
author = {Qihao Zhao and Yangyu Huang and Tengchao Lv and Lei Cui and Qinzheng Sun and Shaoguang Mao and Xin Zhang and Ying Xin and Qiufeng Yin and Scarlett Li and Furu Wei},
journal= {arXiv preprint arXiv:2412.15194},
year = {2025}
}