Llama-Nemotron:高效推理模型
计算与语言
2025-09-10 v5 人工智能
机器学习
摘要
我们推出了Llama-Nemotron系列模型,这是一个开放的异构推理模型家族,提供卓越的推理能力、推理效率以及面向企业使用的开放许可。该家族包含三种规模——Nano(8B)、Super(49B)和Ultra(253B)——其性能可与最先进的推理模型(如DeepSeek-R1)相媲美,同时提供更优的推理吞吐量和内存效率。在本报告中,我们讨论了这些模型的训练过程,包括使用来自Llama 3模型的神经架构搜索以加速推理、知识蒸馏和持续预训练,随后是专注于推理的后训练阶段,该阶段包含两个主要部分:监督微调和大规模强化学习。Llama-Nemotron模型是首批支持动态推理切换的开源模型,允许用户在推理过程中在标准聊天模式和推理模式之间切换。为进一步支持开放研究并促进模型开发,我们提供以下资源:1. 我们根据商业许可的NVIDIA开放模型许可协议,发布Llama-Nemotron推理模型——LN-Nano、LN-Super和LN-Ultra。2. 我们发布完整的后训练数据集:Llama-Nemotron-Post-Training-Dataset。3. 我们还发布我们的训练代码库:NeMo、NeMo-Aligner和Megatron-LM。
引用
@article{arxiv.2505.00949,
title = {Llama-Nemotron: Efficient Reasoning Models},
author = {Akhiad Bercovich and Itay Levy and Izik Golan and Mohammad Dabbah and Ran El-Yaniv and Omri Puny and Ido Galil and Zach Moshe and Tomer Ronen and Najeeb Nabwani and Ido Shahaf and Oren Tropp and Ehud Karpas and Ran Zilberstein and Jiaqi Zeng and Soumye Singhal and Alexander Bukharin and Yian Zhang and Tugrul Konuk and Gerald Shen and Ameya Sunil Mahabaleshwarkar and Bilal Kartal and Yoshi Suhara and Olivier Delalleau and Zijia Chen and Zhilin Wang and David Mosallanezhad and Adi Renduchintala and Haifeng Qian and Dima Rekesh and Fei Jia and Somshubra Majumdar and Vahid Noroozi and Wasi Uddin Ahmad and Sean Narenthiran and Aleksander Ficek and Mehrzad Samadi and Jocelyn Huang and Siddhartha Jain and Igor Gitman and Ivan Moshkov and Wei Du and Shubham Toshniwal and George Armstrong and Branislav Kisacanin and Matvei Novikov and Daria Gitman and Evelina Bakhturina and Prasoon Varshney and Makesh Narsimhan and Jane Polak Scowcroft and John Kamalu and Dan Su and Kezhi Kong and Markus Kliegl and Rabeeh Karimi Mahabadi and Ying Lin and Sanjeev Satheesh and Jupinder Parmar and Pritam Gundecha and Brandon Norick and Joseph Jennings and Shrimai Prabhumoye and Syeda Nahida Akter and Mostofa Patwary and Abhinav Khattar and Deepak Narayanan and Roger Waleffe and Jimmy Zhang and Bor-Yiing Su and Guyue Huang and Terry Kong and Parth Chadha and Sahil Jain and Christine Harvey and Elad Segal and Jining Huang and Sergey Kashirsky and Robert McQueen and Izzy Putterman and George Lam and Arun Venkatesan and Sherry Wu and Vinh Nguyen and Manoj Kilaru and Andrew Wang and Anna Warno and Abhilash Somasamudramath and Sandip Bhaskar and Maka Dong and Nave Assaf and Shahar Mor and Omer Ullman Argov and Scot Junkin and Oleksandr Romanenko and Pedro Larroy and Monika Katariya and Marco Rovinelli and Viji Balas and Nicholas Edelman and Anahita Bhiwandiwalla and Muthu Subramaniam and Smita Ithape and Karthik Ramamoorthy and Yuting Wu and Suguna Varshini Velury and Omri Almog and Joyjit Daw and Denys Fridman and Erick Galinkin and Michael Evans and Shaona Ghosh and Katherine Luna and Leon Derczynski and Nikki Pope and Eileen Long and Seth Schneider and Guillermo Siman and Tomasz Grzegorzek and Pablo Ribalta and Monika Katariya and Chris Alexiuk and Joey Conway and Trisha Saar and Ann Guan and Krzysztof Pawelec and Shyamala Prayaga and Oleksii Kuchaiev and Boris Ginsburg and Oluwatobi Olabiyi and Kari Briski and Jonathan Cohen and Bryan Catanzaro and Jonah Alben and Yonatan Geifman and Eric Chung},
journal= {arXiv preprint arXiv:2505.00949},
year = {2025}
}