中文

Attention Residuals(注意力残差)

计算与语言 2026-03-17 v1

摘要

采用 PreNorm 的残差连接是现代大语言模型(LLM)的标准配置,但它们以固定权重累积所有层输出。这种均匀聚合导致隐藏状态随深度无控制增长,逐步稀释每一层的贡献。我们提出了 Attention Residuals(AttnRes),用softmax 注意力替代这种固定累积,使其对先前层输出进行加权,允许每一层以学习到的、依赖于输入的权重选择性地聚合早期表示。为解决在大规模模型训练中对所有先前层输出进行注意力计算所带来的内存和通信开销,我们引入了 Block AttnRes,将层划分为块并在块级表示上进行注意力计算,在减少内存占用同时保留了完整 AttnRes 的大部分增益。结合基于缓存的流水线通信和双阶段计算策略,Block AttnRes 成为标准残差连接的实用即插即用替代方案。缩放律实验证实该改进在不同模型规模下保持一致,消融实验验证了内容依赖的深度方向选择的好处。我们进一步将 AttnRes 集成到 Kimi Linear 架构(总计 48B / 激活 3B 参数)中,并在 1.4T tokens 上进行预训练,AttnRes 缓解了 PreNorm 稀释效应,在深度方向上产生了更均匀的输出幅度和梯度分布,并在所有评估任务上提升了下游性能。

关键词

引用

@article{arxiv.2603.15031,
  title  = {Attention Residuals},
  author = {Kimi Team and Guangyu Chen and Yu Zhang and Jianlin Su and Weixin Xu and Siyuan Pan and Yaoyu Wang and Yucheng Wang and Guanduo Chen and Bohong Yin and Yutian Chen and Junjie Yan and Ming Wei and Y. Zhang and Fanqing Meng and Chao Hong and Xiaotong Xie and Shaowei Liu and Enzhe Lu and Yunpeng Tai and Yanru Chen and Xin Men and Haiqing Guo and Y. Charles and Haoyu Lu and Lin Sui and Jinguo Zhu and Zaida Zhou and Weiran He and Weixiao Huang and Xinran Xu and Yuzhi Wang and Guokun Lai and Yulun Du and Yuxin Wu and Zhilin Yang and Xinyu Zhou},
  journal= {arXiv preprint arXiv:2603.15031},
  year   = {2026}
}

备注

attnres tech report