中文

Nemotron-Flash:面向低延迟混合小型语言模型

机器学习 2025-11-25 v1 人工智能

摘要

小型语言模型(SLM)的高效部署对于具有严格延迟约束的众多实际应用至关重要。虽然之前的 SLM 设计工作主要致力于减少参数数量以实现参数最优的 SLM,但参数效率并不一定转化为实际设备上的比例速度提升。本工作旨在识别 SLM 实际设备延迟的关键决定因素,并为以实际设备延迟为首要考虑的 SLM 设计和训练提供可通用的原则和方法。具体而言,我们确定了两个核心架构因素:深度-宽度比和算子选择。前者对于小批量延迟至关重要,而后者影响延迟和大批量吞吐量。基于此,我们首先研究最优深度-宽度比,关键发现表明:尽管在相同参数预算下,浅宽模型通常实现更好的准确率,但它们可能不位于准确率-延迟权衡的前沿。随后,我们探索新兴的高效注意力替代方案,以评估其作为候选构建算子的潜力。利用识别出的有前景的算子,我们构建了一个演化搜索框架,用于自动发现混合 SLM 中这些算子的最优组合,从而推动准确率-延迟前沿的提升。除架构改进外,我们进一步通过一种权重归一化技术来增强 SLM 训练,该技术实现更有效的权重更新并提高最终收敛性。综合这些方法,我们引入了一套新的混合 SLM 家族,称为Nemotron-Flash,显著提升了最新 SLM 的准确率-效率前沿,例如相较于 Qwen3-1.7B/0.6B 实现了超过 +5.5% 的平均准确率提升、1.3 倍/1.9 倍的延迟降低,以及 18.7 倍/45.6 倍的吞吐量提升。

关键词

引用

@article{arxiv.2511.18890,
  title  = {Nemotron-Flash: Towards Latency-Optimal Hybrid Small Language Models},
  author = {Yonggan Fu and Xin Dong and Shizhe Diao and Matthijs Van keirsbilck and Hanrong Ye and Wonmin Byeon and Yashaswi Karnati and Lucas Liebenwein and Hannah Zhang and Nikolaus Binder and Maksim Khadkevich and Alexander Keller and Jan Kautz and Yingyan Celine Lin and Pavlo Molchanov},
  journal= {arXiv preprint arXiv:2511.18890},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025