中文

线性注意力的自由度:以最优特征效率蒸馏Softmax注意力

机器学习 2025-07-08 v1 机器学习

摘要

线性注意力作为一种计算高效的softmax注意力近似方法,尤其适用于长序列,已引起关注。近期研究探索了将预训练Transformer中的softmax注意力蒸馏到线性注意力中。然而,一个关键挑战仍然存在:如何选择控制近似质量的特征维度。现有方法在所有注意力层中统一固定此维度,忽略了它们不同的角色和复杂度。在本文中,我们提出一种基于统计自由度概念自动确定线性注意力中特征维度的原则性方法,该自由度表示输入的有效维度。我们给出了近似误差的理论界,并表明在固定计算预算下,由我们的方法选择的维度能实现更小的误差。此外,我们引入了一种高效的逐层训练策略,以学习针对每层定制的非线性特征。在多个预训练Transformer上的实验表明,与基线相比,我们的方法在不增加推理成本的情况下提升了蒸馏模型的性能。我们的发现还揭示了注意力机制复杂度在各层间的演化方式。

关键词

引用

@article{arxiv.2507.03340,
  title  = {Degrees of Freedom for Linear Attention: Distilling Softmax Attention with Optimal Feature Efficiency},
  author = {Naoki Nishikawa and Rei Higuchi and Taiji Suzuki},
  journal= {arXiv preprint arXiv:2507.03340},
  year   = {2025}
}

备注

18 pages, 1 figure