中文

深度混合注意力

计算与语言 2026-03-17 v1 人工智能

摘要

深度是大语言模型(LLM)的关键扩展驱动力。然而,随着LLM变得更深,它们常常出现信号退化:浅层层 forming的信息性特征被反复残差更新逐渐稀释,使其在更深层难以恢复。我们提出深度混合注意力(mixture-of-depths attention, MoDA),一种机制,使每个注意力头能够注意当前层和来自前置层的深度KV配对。我们进一步描述了一种硬件高效的MoDA算法,解决非连续内存访问模式,实现在序列长度为64K时达到FlashAttention-2效率的97.3%。在15亿参数模型上的实验表明,MoDA consistently优于强大基线。值得注意的是,它在10个验证基准上的平均困惑度降低0.2,在10个下游任务上的平均性能提升2.11%,仅增加3.7%的FLOPs计算开销。我们还发现,将MoDA与后规范(pre-norm)搭配的效果优于与前规范(pre-norm)搭配。这些结果表明,MoDA是深度扩展的有前景原语。代码已发布于https://github.com/hustvl/MoDA。

关键词

引用

@article{arxiv.2603.15619,
  title  = {Mixture-of-Depths Attention},
  author = {Lianghui Zhu and Yuxin Fang and Bencheng Liao and Shijie Wang and Tianheng Cheng and Zilong Huang and Chen Chen and Lai Wei and Yutao Zeng and Ya Wang and Yi Lin and Yu Li and Xinggang Wang},
  journal= {arXiv preprint arXiv:2603.15619},
  year   = {2026}
}

备注

Code is released at https://github.com/hustvl/MoDA