中文

NeurIPS 2025 E2LM 竞赛:语言模型早期训练评估

人工智能 2025-06-10 v1

摘要

现有的基准测试对评估完全训练的大型语言模型效果良好。然而,我们发现小型模型在早期训练阶段存在显著差异,而这些差异往往难以通过基准测试提供有意义或判别性的信号。为探讨这些差异如何产生,本竞赛旨在设计专为衡量语言模型早期训练进度而定制的科学知识评估任务。邀请参赛者开发新的评估方法或改造现有基准测试,以更好地捕捉语言模型之间的性能差异。为支持这一努力,我们提供了三个预训练的小型模型(参数量为 0.5B、1B 和 3B),以及在训练至 2000 亿 token 期间采样的中间检查点。所有实验和开发工作可在广泛可用的免费云端 GPU 平台上运行,使具有有限计算资源的研究者也能参与其中。提交将依据三个标准进行评估:产生的绩效信号质量、在 1 万亿 token 训练下模型排名的一致性,以及其与科学知识领域的相关性。通过促进为早期训练设计定制化评估策略,本竞赛旨在吸引来自各个领域的广泛参与者,包括那些可能不是机器学习专家或没有专用 GPU 资源的研究者。最终目标是使基础语言模型研究在模型开发的最早阶段变得更系统化和以基准测试为导向。

关键词

引用

@article{arxiv.2506.07731,
  title  = {NeurIPS 2025 E2LM Competition : Early Training Evaluation of Language Models},
  author = {Mouadh Yagoubi and Yasser Dahou and Billel Mokeddem and Younes Belkada and Phuc H. Le-Khac and Basma El Amel Boussaha and Reda Alami and Jingwei Zuo and Damiano Marsili and Mugariya Farooq and Mounia Lalmas and Georgia Gkioxari and Patrick Gallinari and Philip Torr and Hakim Hacid},
  journal= {arXiv preprint arXiv:2506.07731},
  year   = {2025}
}