中文

长上下文感知的升级:混合 LLM 规模的新范域

计算与语言 2026-04-28 v1 机器学习

摘要

混合序列模型将高效 Transformer 组件与线性序列建模块结合起来,是纯 Transformer 的有前景的替代方案,但大多数模型仍需从头预训练,因而无法利用现有的 Transformer 检查点。我们研究了将预训练的 Transformer LLM 转换为混合架构的升级路径,同时保持短上下文质量并提升长上下文能力。我们提出的解决方案 \emph{HyLo}(HYbrid LOng-context):一种长上下文升级配方,结合架构调整与高效 Transformer 块、Multi-Head Latent Attention(MLA)和线性块(Mamba2 或 Gated DeltaNet),并配合分阶段长上下文训练和教师引导蒸馏,以实现稳定优化。HyLo 通过高效后训练将可用上下文长度延长至最高 32×32\times,并将 KV 缓存内存降低超过 90%90\%,在我们的 \texttt{vLLM} 推理堆栈中实现最高 200 万 token 的预填充和解码,而相当的 Llama 基线在超过 64K 上下文后就会耗尽内存。在 1B 和 3B 规模设置(Llama 和 Qwen 变体)上,HyLo 在短上下文和长上下文性能上均表现出色,并在诸如 RULER 等长上下文评估中显著优于最新的升级混合基线。值得注意的是,在相同规模下,HyLo-Qwen-1.7B 仅通过 100 亿 token 的训练即可在 GSM8K、Lm-Harness 常识推理和 RULER-64K 上显著优于 JetNemotron(在 4000 亿 token 上训练)。

关键词

引用

@article{arxiv.2604.24715,
  title  = {Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling},
  author = {Parsa Ashrafi Fashi and Utkarsh Saxena and Mehdi Rezagholizadeh and Aref Jafari and Akash Haridas and Mingyu Yang and Vansh Bhatia and Guihong Li and Vikram Appia and Emad Barsoum},
  journal= {arXiv preprint arXiv:2604.24715},
  year   = {2026}
}