Star Elastic:具备高效预算控制的多任务推理 LLM
摘要
训练大型语言模型 (LLM) 家族(要么从头开始,要么通过迭代压缩)在成本和效率方面都极具挑战性,需要为每个模型执行独立的训练。本文提出 Star Elastic,一种新的 LLM 后训练方法,通过单次 post-training 作业为给定的父级推理模型添加 N 个嵌套子模型(实现 N 倍节省),从而支持在一个运行中生成多个模型。除减少训练成本外,Star Elastic 还解决了高效推理的根本局限性:静态架构对资源分配的刚性要求,无论 token 难度如何都必须分配恒定资源。通过实现弹性预算控制,Star Elastic 启用了一种新型推理方案,为每个推理阶段(思考和回答)使用不同的子模型。Star Elastic 支持 (1) 在 SSM、嵌入通道、MoE 和 FFN 轴向进行嵌套;(2) 通过端到端可训练路由学习嵌套子模型;(3) 基于课程的知识蒸馏。基于 Nemotron Elastic 框架,我们将 Star Elastic 应用于 NVIDIA Nemotron Nano 模型,特别关注混合 Mixture-of-Experts (MoE) 架构:从 Nemotron Nano v3 (30B/3.6A) 生成 23B (2.8A) 和 12B (2.0A) 变体,训练 160B token。所有嵌套模型均与规模相当的独立训练基线相当或更好,且相较于从头预训练节省 360 倍,相较于最先进的压缩方法节省 7 倍。关键在于,弹性预算控制推动了准确率-延迟 Pareto 前沿的提升,通过动态 per-phase 模型选择实现最高 16% 的准确率提升和 1.9 倍的延迟降低。我们进一步将 Star Elastic 扩展到量化 regime,通过 Quantization-Aware Distillation (QAD) 生成嵌套的 NVFP4 和 FP8 弹性检查点,保持零-shot slicing 同时实现更小的部署占用。
引用
@article{arxiv.2605.07182,
title = {Star Elastic: Many-in-One Reasoning LLMs with Efficient Budget Control},
author = {Ali Taghibakhshi and Ruisi Cai and Saurav Muralidharan and Sharath Turuvekere Sreenivas and Aditya Vavre and Ameya Sunil Mahabaleshwarkar and Bilal Kartal and Sheldon Liang and Marcin Chochowski and Zijia Chen and Akhiad Bercovich and Ran Zilberstein and Ran El-Yaniv and Yonatan Geifman and Daniel Korzekwa and Yoshi Suhara and Oluwatobi Olabiyi and Ashwath Aithal and Nima Tajbakhsh and Pavlo Molchanov},
journal= {arXiv preprint arXiv:2605.07182},
year = {2026}
}