通过 KL 引导层选择蒸馏混合注意力模型
计算与语言
2025-12-24 v1 人工智能
摘要
将预训练的softmax注意力Transformer蒸馏为更高效的混合注意力架构(交替使用softmax和线性注意力层)是一种在不需从头预训练的情况下提高大语言模型推理效率的有前景的做法。转换过程中的关键因素是层选择,即决定在哪些层转换为线性注意力变体。本文描述了一种简单高效的层选择配方,利用从小量通用文本数据上训练得到的层重要性得分。一旦确定了层选择,我们使用最近的蒸馏流程[cite: RADLADS, goldstein2025radlads],包括注意力权重迁移、隐藏状态对齐、KL基于分布匹配,随后进行少量微调。我们发现,这种方法比现有方法更有效,后者包括基于固定比例均匀交错线性注意力的启发式方法,以及依赖特定诊断数据集的方法。
引用
@article{arxiv.2512.20569,
title = {Distilling to Hybrid Attention Models via KL-Guided Layer Selection},
author = {Yanhong Li and Songlin Yang and Shawn Tan and Mayank Mishra and Rameswar Panda and Jiawei Zhou and Yoon Kim},
journal= {arXiv preprint arXiv:2512.20569},
year = {2025}
}