中文

持续低秩缩放点积注意力

计算机视觉与模式识别 2025-07-29 v4 机器学习

摘要

Transformer 因其捕获序列处理中数据关系的能力而广泛应用, 在广泛的静态任务中取得了巨大成功. 然而, 其主要组成部分即缩放点积注意力的计算和内存占用常被忽视. 这使得其在面向流数据处理且受响应延迟、计算和内存资源约束的应用中不可行. 一些工作提出了降低 Transformer 计算成本的方法, 即低秩近似、注意力稀疏化以及面向持续推断的高效公式. 本文引入一种基于 Nystr"om 近似的缩放点积注意力新公式, 适用于持续推断. 在针对在线音频分类和在线动作检测任务进行的实验中, 提出的持续缩放点积注意力可将运算次数降低最高可达三个数量级, 同时保持与竞争模型相当的预测性能.

关键词

引用

@article{arxiv.2412.03214,
  title  = {Continual Low-Rank Scaled Dot-product Attention},
  author = {Ginés Carreto Picón and Illia Oleksiienko and Lukas Hedegaard and Arian Bakhtiarnia and Alexandros Iosifidis},
  journal= {arXiv preprint arXiv:2412.03214},
  year   = {2025}
}

备注

16 pages, 7 figures