测试集预训练已不再是唯一所需:基于辩论的方法评估QA基准
计算与语言
2025-08-11 v2 人工智能
摘要
随着前沿语言模型在标准QA基准测试中的表现日益饱和,关于数据污染、记忆以及日益昂贵的数据集创建成本的担忧仍然存在。我们提出一种基于辩论的评估范式,将任何现有的QA数据集转换为结构化的对抗性辩论——其中一个模型被给予官方答案进行辩护,另一个模型构建并辩护备选答案,由对正确解毫无了解的仲裁者进行裁决。通过迫使多轮论证,该方法在保持不增加数据制作成本的同时,显著增加了难度并惩罚浅层记忆。我们做出了两个主要贡献:(1)一个系统性地将QA任务转换为基于辩论的评估管道,(2)一个公开的基准,演示了该范式在MMLU-Pro部分问题上的有效性,包括标准化的协议和参考模型。实证结果验证了该方法的稳健性及其对抗数据污染的有效性——一个在测试问题上进行微调的Llama 3.1模型显示出显著的准确率提升(50%→82%),但在辩论中表现更差。结果还表明,即使是较弱的评判器也能可靠地区分更强的辩手,这突显了基于辩论的评估方法如何能够扩展到更具挑战性的系统,同时保持创建新基准成本的少量。总体而言,我们的框架强调“测试集预训练已不再是唯一所需”,为衡量先进语言模型的真实推理能力提供了可持续的路径。
引用
@article{arxiv.2507.17747,
title = {Pretraining on the Test Set Is No Longer All You Need: A Debate-Driven Approach to QA Benchmarks},
author = {Linbo Cao and Jinman Zhao},
journal= {arXiv preprint arXiv:2507.17747},
year = {2025}
}
备注
22 pages, 7 figures. Accepted to COLM 2025. Code available at: github.com/l6cao/Debate-Driven-Evaluation