Apriel-H1:面向高效企业推理模型
机器学习
2025-11-05 v1 人工智能
摘要
大型语言模型 (LLM) 通过带有注意力机制的 transformer 架构实现了显著的推理能力。然而,transformer 在注意力模块 (MHA) 中存在二次时间和内存复杂度,并在推理期间需要缓存键值状态,这严重限制了吞吐量和可扩展性。高推理吞吐量对于 agent 任务、长上下文推理、在高请求负载下的高效部署以及更高效的测试时计算扩展至关重要。状态空间模型 (SSM) 如 Mamba 作为具有线性推理复杂度和通过固定大小隐藏状态实现恒定内存占用的递归计算的有前景的替代方案。在本技术报告中,我们介绍了 Apriel-H1 系列的混合 LLM,它们组合 transformer 注意力和 SSM 序列混合器,以在 15B 模型规模上实现高效推理。这些模型通过从预训练的推理 transformer、Apriel-Nemotron-15B-Thinker 持续蒸馏而来,逐步替换不太关键的注意力层为线性 Mamba 块。我们发布了多个 Apriel-H1-15B-Thinker 的后蒸馈变体,包含不同的 SSM 与 MHA 比例,并分析了随着更多 Mamba 层替换 MHA 而推理性能如何退化。此外,我们发布了 30/50 混合变体的 Apriel-H1,进一步在推理痕迹的监督数据集上微调,实现了在生产就绪的 vLLM 环境中推理吞吐量提升 2 倍以上,同时在推理性能方面几乎没有退化。这表明,经过蒸馈的混合 SSM-Transformer 架构可以在不显著牺牲推理质量的前提下,为等效的预训练 transformer 提供了显著的效率收益。
引用
@article{arxiv.2511.02651,
title = {Apriel-H1: Towards Efficient Enterprise Reasoning Models},
author = {Oleksiy Ostapenko and Luke Kumar and Raymond Li and Denis Kocetkov and Joel Lamy-Poirier and Shruthan Radhakrishna and Soham Parikh and Shambhavi Mishra and Sebastien Paquet and Srinivas Sunkara and Valérie Bécaert and Sathwik Tejaswi Madhusudhan and Torsten Scholak},
journal= {arXiv preprint arXiv:2511.02651},
year = {2025}
}