中文

多混合模型:通过共享表征实现灵活的序列建模

机器学习 2026-05-28 v1

摘要

Softmax 注意力是现代大型语言模型的基石,但其内存随序列长度线性增长,计算复杂度呈二次方。线性循环模型,如线性注意力和状态空间模型,因其线性计算和恒定内存而广受关注作为注意力的替代方案。虽然这些亚二次 token 混合方法(即混合器)在广泛基准测试中实现了有前景的效率提升和竞争性能,但当前的线性循环模型在需要长程检索或 in-context 学习的任务上仍落后于注意力。越来越多的工作研究混合架构,试图通过静态交错或合并注意力和循环块来缓解这些权衡。在本文中,我们探索了一种新的混合模型开发轴向:跨越 token 序列。我们提出 Oryx,一种混合模型,可在整个序列中灵活地在不同混合器之间切换,例如在丰富上下文利用时使用注意力,在高效生成时使用线性循环。Oryx 在混合器间共享至少 90% 的参数,使注意力和循环模式能够在共享的内部表征上运行。我们通过 Mamba-2 和 Gated DeltaNet 变体(最高达 14 亿参数)验证了我们的设计。在固定 token 预算和混合训练策略下,Oryx 在多个语言建模任务上实现与单一混合器基线相当或更好的性能。在 14 亿参数规模下,Oryx 的所有实例在平均语言建模任务上均优于各自的基线至少 0.7 个百分点。在检索任务上,Oryx 即使仅以注意力模式处理不到 10% 的 token,也能实现与 Transformer 基线相当的性能。这些结果表明注意力和线性循环模型可以共享内部表征,动机跨序列轴混合化为有前景的方向。

关键词

引用

@article{arxiv.2605.28769,
  title  = {Multi-Mixer Models: Flexible Sequence Modeling with Shared Representations},
  author = {Kevin Y. Li and Asher Trockman and Ananda Theertha Suresh and Ziteng Sun},
  journal= {arXiv preprint arXiv:2605.28769},
  year   = {2026}
}