Apriel-Nemotron-15B-Thinker
机器学习
2025-08-18 v1 人工智能
摘要
虽然大型语言模型(LLM)在代码、数学及其他企业任务等领域取得了显著的推理能力,但其巨大的内存和计算成本常常使其在实际企业环境中难以应用。为此,我们引入Apriel-Nemotron-15B-Thinker,这是ServiceNow Apriel SLM系列中的一个150亿参数模型,虽然仅拥有其它中等规模SOTA模型(如o1-mini、QWQ32B、EXAONE-Deep-32B)的一半内存占用,却实现了与这些模型相当的性能。Apriel-Nemotron-15B-Thinker模型采用四阶段训练流程,包括:1)基础模型放大、2)持续预训练、3)监督微调(SFT)以及4)使用GRPO的强化学习。广泛的评估表明,我们的Apriel-Nemotron-15B-Thinker模型在 diverse suite of benchmarks 上一致表现出与320亿参数模型相当或更好的性能,尽管其规模仅为其一半。
引用
@article{arxiv.2508.10948,
title = {Apriel-Nemotron-15B-Thinker},
author = {Shruthan Radhakrishna and Soham Parikh and Gopal Sarda and Anil Turkkan and Quaizar Vohra and Raymond Li and Dhruv Jhamb and Kelechi Ogueji and Aanjaneya Shukla and Oluwanifemi Bamgbose and Toby Liang and Luke Kumar and Oleksiy Ostapenko and Shiva Krishna Reddy Malay and Aman Tiwari and Tara Bogavelli and Vikas Yadav and Jash Mehta and Saloni Mittal and Akshay Kalkunte and Pulkit Pattnaik and Khalil Slimi and Anirudh Sreeram and Jishnu Nair and Akintunde Oladipo and Shashank Maiya and Khyati Mahajan and Rishabh Maheshwary and Masoud Hashemi and Sai Rajeswar Mudumba and Sathwik Tejaswi Madhusudhan and Torsten Scholak and Sebastien Paquet and Sagar Davasam and Srinivas Sunkara},
journal= {arXiv preprint arXiv:2508.10948},
year = {2025}
}