训练于测试任务会混淆评估与涌现现象
计算与语言
2025-04-22 v3 人工智能
机器学习
摘要
我们研究了大型语言模型评估中的一个根本性问题,即训练于测试任务。与训练于测试数据、数据泄露或数据污染等错误做法不同,训练于测试任务并不构成不当行为。该术语描述了一系列日益增长的实践,这些实践在训练时利用对评估任务的知识。我们展示,训练于测试任务会混淆相对模型评估以及关于涌现能力的论断。我们认为,一个模型家族在某项基准测试中看似优于另一个模型家族,可能是由于对测试任务训练程度的不同。为此,我们提出了一种有效的方法,用于调整测试基准评估中训练于测试任务的影响。简单来说,就是在评估前对每个进行比较的模型在同一任务相关数据上进行微调。我们表明,随着模型对测试任务的训练,涌现行为的实例会逐渐消失。我们的工作提出了一种关于大型语言模型评估的新视角,对基准测试和涌现能力研究具有广泛影响。
引用
@article{arxiv.2407.07890,
title = {Training on the Test Task Confounds Evaluation and Emergence},
author = {Ricardo Dominguez-Olmedo and Florian E. Dorner and Moritz Hardt},
journal= {arXiv preprint arXiv:2407.07890},
year = {2025}
}
备注
ICLR 2025 (Oral)