持续低秩缩放点积注意力
计算机视觉与模式识别
2025-07-29 v4 机器学习
摘要
Transformer 因其捕获序列处理中数据关系的能力而广泛应用, 在广泛的静态任务中取得了巨大成功. 然而, 其主要组成部分即缩放点积注意力的计算和内存占用常被忽视. 这使得其在面向流数据处理且受响应延迟、计算和内存资源约束的应用中不可行. 一些工作提出了降低 Transformer 计算成本的方法, 即低秩近似、注意力稀疏化以及面向持续推断的高效公式. 本文引入一种基于 Nystr"om 近似的缩放点积注意力新公式, 适用于持续推断. 在针对在线音频分类和在线动作检测任务进行的实验中, 提出的持续缩放点积注意力可将运算次数降低最高可达三个数量级, 同时保持与竞争模型相当的预测性能.
关键词
引用
@article{arxiv.2412.03214,
title = {Continual Low-Rank Scaled Dot-product Attention},
author = {Ginés Carreto Picón and Illia Oleksiienko and Lukas Hedegaard and Arian Bakhtiarnia and Alexandros Iosifidis},
journal= {arXiv preprint arXiv:2412.03214},
year = {2025}
}
备注
16 pages, 7 figures