Super Apriel:一个检查点,多种速度
摘要
我们发布了 Super Apriel,这是一个拥有 150 亿参数的超网络,其中每个解码器层提供四种训练好的混合器选择——全注意力 (FA)、滑动窗口注意力 (SWA)、Kimi Delta Attention (KDA) 和 Gated DeltaNet (GDN)。一个放置方案为每层选择一个混合器;在服务时可以在不重新加载权重的情况下在请求之间切换放置方案,从而实现从单个检查点获得多种速度预设。共享的检查点还支持投机解码,而无需单独的草稿模型。全 FA 预设在所有报告的基准上与 Apriel 1.6 教师模型相匹配;推荐的混合预设跨越 到 的解码吞吐量,质量保持率为 96% 到 77%,且吞吐量优势在更长的上下文长度下会叠加放大。在 48 层中具有四种混合器类型,配置空间非常庞大。一个根据每层混合器分配预测放置质量的代理模型使得速度-质量前景变得易于处理,并能在每个速度级别下识别出最佳权衡。我们研究了每个速度级别下的最佳配置是在训练早期就能识别,还是仅在收敛后才能识别。排名在 0.5B 规模时迅速稳定,但最高效的配置在 15B 规模时表现出更高的不稳定性,这提醒人们不要从较小模型进行外推。Super Apriel 通过从冻结的 Apriel 1.6 教师模型进行随机蒸馏来训练,随后进行监督微调。我们发布了超网络权重、Fast-LLM 训练代码、vLLM 服务代码以及一个放置优化工具包。
引用
@article{arxiv.2604.19877,
title = {Super Apriel: One Checkpoint, Many Speeds},
author = {SLAM Labs and : and Oleksiy Ostapenko and Raymond Li and Torsten Scholak and Alireza Mousavi-Hosseini and Aman Tiwari and Denis Kocetkov and Joel Lamy Poirier and Kelechi Ogueji and Nanda H Krishna and Rafael Pardinas and Sathwik Tejaswi Madhusudhan and Shruthan Radhakrishna and Srinivas Sunkara and Valerie Becaert},
journal= {arXiv preprint arXiv:2604.19877},
year = {2026}
}
备注
Models: https://huggingface.co/ServiceNow-AI/SuperApriel-15B-Base and https://huggingface.co/ServiceNow-AI/SuperApriel-15B-Instruct . Dev model: https://huggingface.co/ServiceNow-AI/SuperApriel-0.5B-Base . Training code: https://github.com/ServiceNow/Fast-LLM . Async RL: https://github.com/ServiceNow/pipeline-rl . Training logs: https://wandb.ai/servicenow-team/Super_Apriel