Nanbeige4-3B 技术报告:探索小型语言模型的前沿
计算与语言
2025-12-09 v1
摘要
我们提出 Nanbeige4-3B,一个规模小但性能卓越的语言模型家族。在 23T 高质量 token 上预训练,并在超过 3000 万条多样化指令上微调,我们将小型语言模型的缩放定律边界向前推进。在预训练中,我们设计了一种细粒度预热-稳定-衰减(FG-WSD)训练调度器,通过各阶段逐步精炼数据混合以提升模型性能。在后训练中,为提高 SFT 数据质量,我们设计了一种联合机制,将深思熟虑生成精炼与思维链重建相结合,在复杂任务上取得了显著提升。SFT 之后,我们利用旗舰推理模型通过提出的双偏好蒸馏(DPD)方法对 Nanbeige4-3B 进行蒸馏,从而带来进一步的性能提升。最后,应用了多阶段强化学习阶段,利用可验证奖励和偏好建模来增强推理能力和人类对齐能力。广泛评估表明,Nanbeige4-3B 不仅在参数规模相当的模型上大幅超越,而且在广泛基准测试中可与更大模型相媲美。模型检查点可在 https://huggingface.co/Nanbeige 获取。
引用
@article{arxiv.2512.06266,
title = {Nanbeige4-3B Technical Report: Exploring the Frontier of Small Language Models},
author = {Chen Yang and Guangyue Peng and Jiaying Zhu and Ran Le and Ruixiang Feng and Tao Zhang and Wei Ruan and Xiaoqi Liu and Xiaoxue Cheng and Xiyun Xu and Yang Song and Yanzipeng Gao and Yiming Jia and Yun Xing and Yuntao Wen and Zekai Wang and Zhenwei An and Zhicong Sun and Zongchao Chen},
journal= {arXiv preprint arXiv:2512.06266},
year = {2025}
}