中文

基于功率的部分注意力:连接线性复杂度与完全注意力

机器学习 2026-01-28 v2

摘要

transformer 研究普遍接受'注意力就是我们所需的一切',但注意力需求的量化从未系统化地探讨过。是否需要二次 O(L2)O(L^2) 注意力,还是存在能实现类似性能的亚二次注意力机制?为回答此问,本文引入基于功率的部分注意力(Power-based Partial Attention, PPA),其复杂度为 O(L1+p)O(L^{1+p}),其中 0p10 \leq p \leq 1。其中 p=0p=0 对应线性复杂度的滑动窗口注意力,p=1p=1 对应完全注意力。通过该注意力构建方式,我们可探讨Transformer架构性能随注意力规模行为变化的规律。实验结果显示,性能呈S型曲线:从滑动窗口(线性复杂度)注意力向完全注意力转变,跨越狭窄的 pp 值区间后趋于平台化。实验表明,存在 0<p<10<p<1 使得 O(L1+p)O(L^{1+p}) 注意力足以实现与 O(L2)O(L^2) 完全注意力相似的效果。

关键词

引用

@article{arxiv.2601.17334,
  title  = {Power-based Partial Attention: Bridging Linear-Complexity and Full Attention},
  author = {Yufeng Huang},
  journal= {arXiv preprint arXiv:2601.17334},
  year   = {2026}
}

备注

12 pages, 3 figures