注意力编辑:面向跨架构注意力转换的通用框架
计算与语言
2026-04-08 v1 人工智能
摘要
键值 (KV) 缓存内存和带宽在长上下文和长生成场景中越来越主导大语言模型的推理成本。多头潜在注意力 (MLA) 和混合滑动窗口注意力 (SWA) 等架构可以缓解这一限制,但将其集成到现有模型仍然困难。先前的方法对源和目标注意力模块都施加细粒度的结构要求,无法满足实际部署的可行要求。我们提出注意力编辑 (Attention Editing),这是一种用于在不从头重新训练的情况下将已训练的大语言模型 (LLM) 转换为具有新注意力架构的实用框架。注意力编辑用可学习的目标模块替换原始注意力模块,并通过渐进蒸馏进行训练,包括 (1) 基于中间激活监督的层级教师强迫优化,以防止冷启动误差累积,以及 (2) 基于下一个标记分布的模型级蒸馏,可选附加弱特征匹配进行正则化。我们在两种不同目标上实现了该框架——MLA 和 GateSWA,这是一种门控混合 SWA 设计,并将其应用于 Qwen3-8B 和 Qwen3-30B-A3B。 resulting models 保持竞争性能,同时实现显著的效率提升,表明大规模注意力转换在可行性和鲁棒性方面都具有优势。值得注意的是,在Ascend 910B 集群上进行实验,提供了在国产硬件上的实际训练案例研究。
引用
@article{arxiv.2604.05688,
title = {Attention Editing: A Versatile Framework for Cross-Architecture Attention Conversion},
author = {Zhen Cheng and Hao-Bo Yang and Wan-Yi Huang and Jin-Long Li},
journal= {arXiv preprint arXiv:2604.05688},
year = {2026}
}