混合线性注意力转换方法中的组件不平衡问题
机器学习
2025-10-13 v2 人工智能
计算与语言
摘要
Transformer 的二次计算复杂度限制了其规模化潜力 despite 卓越性能。线性注意力将复杂度降低为线性,但从头训练此类模型在大多数情况下仍不可行。近期的后训练线性化方法以混合方式高效转换预训练 Transformer 为线性模型,常组合线性注意力与滑动窗口 softmax。我们识别出关键缺陷:现有混合方法实际上绕过了线性组件,几乎完全依赖 SWA。组件级诊断揭示了这一隐藏行为源于常见基准测试上的评估实践。我们提出三大解决方案确保组件使用平衡:(i) 在推理时将线性模型转换与滑动窗口 softmax 混合;(ii) HedgeCATs,结合注意力权重迁移与针对性 LoRA 微调;(iii) Scheduled Sliding-window Dropout (SSD),在训练期间随机抑制 softmax 分支以防止组件坍塌。我们的方法保持计算效率,同时恢复大部分基础模型性能,确保真正采用线性注意力,恢复混合转换中性能归因的有效性。
关键词
引用
@article{arxiv.2510.05901,
title = {Untangling Component Imbalance in Hybrid Linear Attention Conversion Methods},
author = {Martin Benfeghoul and Teresa Delgado and Adnan Oomerjee and Haitham Bou Ammar and Jun Wang and Zafeirios Fountas},
journal= {arXiv preprint arXiv:2510.05901},
year = {2025}
}