Tulu 3:推动开放语言模型后训练的前沿
计算与语言
2025-04-16 v5
摘要
语言模型后训练被用于优化行为和提升新技能,广泛应用于近期众多语言模型,但应用这些技术的开放方案落后于专有方案。后训练的基础训练数据和方案是整个问题中最关键的部分,同时也是透明度最低的部分。为弥合这一差距,我们推出了Tulu 3,一个全开放的最先进后训练模型家族,并附带其数据、代码和训练方案,作为现代后训练技术的综合指南。Tulu 3基于Llama 3.1基础模型构建,其性能超越了Llama 3.1、Qwen 2.5、Mistral的指令版本,甚至超过了GPT-4o-mini和Claude 3.5-Haiku等闭源模型。我们模型的训练算法包括监督微调(SFT)、直接偏好优化(DPO)以及一种新颖的、我们称之为可验证奖励强化学习(RLVR)的方法。借助Tulu 3,我们引入了一套用于后训练方案的多任务评估体系,包括开发和未见过的评估、标准基准实现,以及对现有开放数据集在所述基准上的大量去污染处理。最后,我们分析了未能稳定提升性能的训练方法并给出讨论。除了Tulu 3模型权重和演示,我们还发布了完整的方案——包括用于多种核心技能的数据集、用于数据整理和评估的健壮工具包、训练代码和基础设施,以及最重要的,一份用于复现和进一步将Tulu 3方法适配到更多领域的详细报告。
关键词
引用
@article{arxiv.2411.15124,
title = {Tulu 3: Pushing Frontiers in Open Language Model Post-Training},
author = {Nathan Lambert and Jacob Morrison and Valentina Pyatkin and Shengyi Huang and Hamish Ivison and Faeze Brahman and Lester James V. Miranda and Alisa Liu and Nouha Dziri and Shane Lyu and Yuling Gu and Saumya Malik and Victoria Graf and Jena D. Hwang and Jiangjiang Yang and Ronan Le Bras and Oyvind Tafjord and Chris Wilhelm and Luca Soldaini and Noah A. Smith and Yizhong Wang and Pradeep Dasigi and Hannaneh Hajishirzi},
journal= {arXiv preprint arXiv:2411.15124},
year = {2025}
}
备注
Added Tulu 3 405B results and additional analyses