中文

M2R2:用于高效Transformer推理的多速率残差混合

计算与语言 2025-02-05 v1 人工智能 机器学习

摘要

残差变换增强了大型语言模型(LLMs)的表示深度和表达能力。然而,在自回归生成中对所有令牌应用静态残差变换会导致推理效率和生成保真度之间的次优权衡。现有方法,包括Early Exiting、Skip Decoding和Mixture-of-Depth,通过基于令牌级复杂度调制残差变换来解决此问题。然而,这些方法主要考虑令牌通过模型层所穿越的距离,忽略了残差演化的底层速度。我们引入了多速率残差混合(M2R2)框架,该框架动态调制残差速度以改善早期对齐,从而提高推理效率。在面向推理的任务(如Koala、Self-Instruct、WizardLM和MT-Bench)上的评估显示,M2R2超越了最先进的基于距离的策略,平衡了生成质量和加速。在自推测解码设置中,M2R2在MT-Bench上实现了高达2.8倍的加速,优于2-model speculative decoding、Medusa、LookAhead Decoding和DEED等方法。在Mixture-of-Experts(MoE)架构中,将早期残差对齐与提前将专家加载到高带宽内存(HBM)相结合,加速了解码,减少了专家切换瓶颈,并实现了2.9倍的加速,使其在资源受限的环境中非常有效。

关键词

引用

@article{arxiv.2502.02040,
  title  = {M2R2: Mixture of Multi-Rate Residuals for Efficient Transformer Inference},
  author = {Nikhil Bhendawade and Mahyar Najibi and Devang Naik and Irina Belousova},
  journal= {arXiv preprint arXiv:2502.02040},
  year   = {2025}
}