中文

OLMo 2 皆可大放异彩

计算与语言 2025-10-09 v3 机器学习

摘要

我们提出 OLMo 2,即我们全开源语言模型的下一代。OLMo 2 包括 7B、13B 和 32B 规模的稠密自回归语言模型家族,完整发布了所有构件——模型权重、完整训练数据、训练代码和配方、训练日志以及数千个中间检查点。本文中,我们描述了我们的修改模型架构和训练配方,重点介绍实现更好训练稳定性和改进每 token 效率的技术。我们更新的预训练数据混合物引入了一种新的、专门的数据混合物 Dolmino Mix 1124,显著提升了模型在许多下游任务基准上的能力,具体通过在预训练的 annealing 阶段(即在专门数据)引入。最后,我们采纳了 T"ulu 3 的最佳实践,开发了 OLMo 2-Instruct,专注于开放式数据并扩展了我们的最终阶段强化学习使用可验证奖励(RLVR)。我们的 OLMo 2 基础模型位于性能与训练计算的帕累托前沿,常常在使用更少 FLOPs 的情况下匹配或超越仅开源权重的模型,如 Llama 3.1、Qwen 2.5 和 Gemma 2,同时完全透明地公开训练数据、代码和配方。我们的全开源 OLMo 2-Instruct 模型在规模相当的开源权重模型中具有竞争力,甚至在某些专有模型如 GPT-3.5 Turbo 和 GPT-4o Mini 中也表现出色。

关键词

引用

@article{arxiv.2501.00656,
  title  = {2 OLMo 2 Furious},
  author = {Team OLMo and Pete Walsh and Luca Soldaini and Dirk Groeneveld and Kyle Lo and Shane Arora and Akshita Bhagia and Yuling Gu and Shengyi Huang and Matt Jordan and Nathan Lambert and Dustin Schwenk and Oyvind Tafjord and Taira Anderson and David Atkinson and Faeze Brahman and Christopher Clark and Pradeep Dasigi and Nouha Dziri and Allyson Ettinger and Michal Guerquin and David Heineman and Hamish Ivison and Pang Wei Koh and Jiacheng Liu and Saumya Malik and William Merrill and Lester James V. Miranda and Jacob Morrison and Tyler Murray and Crystal Nam and Jake Poznanski and Valentina Pyatkin and Aman Rangapur and Michael Schmitz and Sam Skjonsberg and David Wadden and Christopher Wilhelm and Michael Wilson and Luke Zettlemoyer and Ali Farhadi and Noah A. Smith and Hannaneh Hajishirzi},
  journal= {arXiv preprint arXiv:2501.00656},
  year   = {2025}
}

备注

Shorter version accepted to COLM 2025. Updated to include 32B results. Model demo available at playground.allenai.org