快速多极注意力:一种面向文本与图像的可扩展多级注意力机制
计算与语言
2025-09-19 v4 机器学习
摘要
尽管 Transformer 网络受益于全局感受野,但其相对于序列长度的二次方代价限制了其在长序列与高分辨率输入上的应用。我们提出快速多极注意力(FMA),一种受 n 体物理中快速多极法启发的自注意力分治机制。FMA 将自注意力的时间与内存复杂度分别从 降至 与 ,同时保留全上下文交互。FMA 包含一个具有 级分辨率的习得层次结构:在该层次中,邻近词元以全分辨率交互,而远端词元通过逐步粗化的习得基函数进行交互。我们分别开发了用于语言与视觉任务的 FMA 一维与二维实现。在自回归与双向语言建模基准上,一维变体以显著更低的内存占用匹配或超越主流高效注意力基线。凭借线性复杂度,二维变体在分类与语义分割任务中展现出优于强力视觉 Transformer 基线的性能。我们的结果证实,由 FMA 实现的多级注意力使基于 Transformer 的模型能够扩展至更长序列与更高分辨率输入而不损失精度,这为开发适用于语言、视觉及多模态任务的可扩展神经网络提供了一种源自物理的系统性方法。我们的代码将发布于 https://github.com/epoch98/FMA。
引用
@article{arxiv.2310.11960,
title = {Fast Multipole Attention: A Scalable Multilevel Attention Mechanism for Text and Images},
author = {Yanming Kang and Giang Tran and Hans De Sterck},
journal= {arXiv preprint arXiv:2310.11960},
year = {2025}
}