SEMA:基于token局部化与平均值的可扩展且高效的Mamba类注意力机制
计算机视觉与模式识别
2025-06-11 v1 人工智能
摘要
注意力是transformer的关键组件。然而,vanilla全注意力在输入规模上的二次计算复杂度,以及线性注意力变体无法聚焦的局限性,长期以来一直是计算机视觉任务的挑战。我们对广义注意力进行数学定义,并在通用框架下构建Vanilla softmax注意力和线性注意力。我们证明,广义注意力具有扩散性,即当键的数量趋于无穷时,查询对所有键分配相等的权重。致力于消除扩散效应并保持聚焦,同时结合Mamba形式注意力的最新发展,我们设计了可扩展且高效的Mamba类注意力(SEMA),其利用token局部化以避免扩散,并通过理论上一致的算术平均来捕获注意力的全局层面。我们在Imagenet-1k上进行支持,其分类结果表明,SEMA是线性注意力之外的可扩展且有效的替代方案,在相似模型参数规模下,能够超越最新的视觉Mamba模型在日益增大的图像规模上的表现。
引用
@article{arxiv.2506.08297,
title = {SEMA: a Scalable and Efficient Mamba like Attention via Token Localization and Averaging},
author = {Nhat Thanh Tran and Fanghui Xue and Shuai Zhang and Jiancheng Lyu and Yunling Zheng and Yingyong Qi and Jack Xin},
journal= {arXiv preprint arXiv:2506.08297},
year = {2025}
}
备注
15 pages, figures 3