中文

解码器-混合-解码器架构:用于高效长文本生成推理

计算与语言 2025-10-28 v3 机器学习

摘要

最近的语言建模进展表明,状态空间模型(SSM)在高效序列建模方面具有优势。虽然混合架构如Samba和解码器-解码器架构YOCO已显示出超越Transformer的性能提升,但先前的工作尚未探讨表示在SSM层之间共享的效率潜力。本文引入了门控记忆单元(GMU),这是一种简单而有效的机制,用于跨层高效内存共享。我们将其应用于创建SambaY,这是一种解码器-混合-解码器架构,集成GMU于跨解码器中,以共享来自基于Samba的自解码器的记忆读出状态。SambaY显著增强了解码效率,保持线性填充时间复杂性,并提升了长上下文性能,同时无需显式位置编码。通过大规模实验,我们展示我们的模型在大规模计算条件下表现出显著低于强大YOCO基线的不可约损失,表明其在大规模计算规模下的性能优势。我们最大的模型通过差分注意力、Phi4-mini-Flash-Reasoning增强,实现了在数学500、AIME24/25和GPQA Diamond等推理任务上显著优于Phi4-mini-Reasoning,同时在vLLM推理框架下实现2K长度提示下的32K生成长度解码吞吐量提升最高可达10倍。我们在https://github.com/microsoft/ArchScale发布了我们的训练代码。

关键词

引用

@article{arxiv.2507.06607,
  title  = {Decoder-Hybrid-Decoder Architecture for Efficient Reasoning with Long Generation},
  author = {Liliang Ren and Congcong Chen and Haoran Xu and Young Jin Kim and Adam Atkinson and Zheng Zhan and Jiankai Sun and Baolin Peng and Liyuan Liu and Shuohang Wang and Hao Cheng and Jianfeng Gao and Weizhu Chen and Yelong Shen},
  journal= {arXiv preprint arXiv:2507.06607},
  year   = {2025}
}

备注

Accepted by NeurIPS 2025. Camera-ready Version