中文

语言模型开发者应报告训练-测试重叠情况

机器学习 2025-07-24 v2 人工智能 计算机与社会 软件工程

摘要

语言模型广泛进行评估,但正确解释评估结果需要了解训练-测试重叠情况,即语言模型在其测试的数据上所训练的程度。当前公开的信息不足:大多数模型没有公开的训练-测试重叠统计信息,第三方无法直接测量训练-测试重叠,因为他们没有访问训练数据。为说明问题,我们记录了 30 位模型开发者的做法,发现仅有 9 位开发者报告训练-测试重叠情况:有 4 位开发者在开源许可证下发布训练数据,使社区能够直接测量训练-测试重叠;另有 5 位开发者发布其训练-测试重叠方法论和统计数据。通过与语言模型开发者合作,我们为另外 3 位开发者提供了关于训练-测试重叠的新信息。总体而言,我们主张语言模型开发者在报告公开测试集上的评估结果时,应发布训练-测试重叠统计数据和/或训练数据。我们希望我们的工作增加对训练-测试重叠透明度,以增加社区对模型评估的信任。

关键词

引用

@article{arxiv.2410.08385,
  title  = {Language model developers should report train-test overlap},
  author = {Andy K Zhang and Kevin Klyman and Yifan Mai and Yoav Levine and Yian Zhang and Rishi Bommasani and Percy Liang},
  journal= {arXiv preprint arXiv:2410.08385},
  year   = {2025}
}

备注

ICML 2025 Spotlight; 23 pages