中文

线性注意力与全局上下文:面向视觉与物理的多极注意力机制

计算机视觉与模式识别 2025-07-04 v1 人工智能 机器学习

摘要

Transformer 已成为从图像分类到物理仿真等众多任务的事实标准。尽管其性能卓越,但标准 Transformer 对于输入长度在内存和时间上的二次复杂度使得难以处理高分辨率输入。因此,提出了多种变体,其中最成功的依赖于分块、下采样或 coarsening 技术,往往以牺牲最细尺度细节为代价。本文采取了不同方法。灵感来自 n-体数值模拟中的前沿技术,我们将注意力视为网格点之间的相互作用问题。我们引入了多极注意力神经算子(Multipole Attention Neural Operator, MANO),其以距离为基础的多尺度方式计算注意力。MANO 在每个注意力头中保持全局感受野,并实现对网格点数量线性的时间和空间复杂度。在图像分类和 Darcy 流动上的实验结果表明,MANO 与 ViT 和 Swin Transformer 等最先进模型相当,同时将运行时间和峰值内存使用降低了数量级。我们开源代码以便复现,地址为 https://github.com/AlexColagrande/MANO。

关键词

引用

@article{arxiv.2507.02748,
  title  = {Linear Attention with Global Context: A Multipole Attention Mechanism for Vision and Physics},
  author = {Alex Colagrande and Paul Caillon and Eva Feillet and Alexandre Allauzen},
  journal= {arXiv preprint arXiv:2507.02748},
  year   = {2025}
}

备注

Accepted at ECLR Workshop at ICCV 2025