基于功率的部分注意力:连接线性复杂度与完全注意力
机器学习
2026-01-28 v2
摘要
transformer 研究普遍接受'注意力就是我们所需的一切',但注意力需求的量化从未系统化地探讨过。是否需要二次 注意力,还是存在能实现类似性能的亚二次注意力机制?为回答此问,本文引入基于功率的部分注意力(Power-based Partial Attention, PPA),其复杂度为 ,其中 。其中 对应线性复杂度的滑动窗口注意力, 对应完全注意力。通过该注意力构建方式,我们可探讨Transformer架构性能随注意力规模行为变化的规律。实验结果显示,性能呈S型曲线:从滑动窗口(线性复杂度)注意力向完全注意力转变,跨越狭窄的 值区间后趋于平台化。实验表明,存在 使得 注意力足以实现与 完全注意力相似的效果。
关键词
引用
@article{arxiv.2601.17334,
title = {Power-based Partial Attention: Bridging Linear-Complexity and Full Attention},
author = {Yufeng Huang},
journal= {arXiv preprint arXiv:2601.17334},
year = {2026}
}
备注
12 pages, 3 figures