LOTFormer:通过低秩最优传输的双随机线性注意力
机器学习
2026-02-10 v2
摘要
Transformer已在多模态中证明高效,但标准softmax注意力随序列长度二次增长,限制了长上下文建模。线性注意力通过核特征映射近似注意力来缓解此问题,但大多数注意力机制仍保持行归一化,可能导致质量过度集中于少数token,损害鲁棒性和信息流。双随机注意力通过在行和列两个维度平衡token参与来对抗此问题,但现有方法常引入显著开销。我们提出LOTFormer,一种从将注意力视为查询与key测度之间耦合的最优传输视角推导的线性时间双随机注意力机制。LOTFormer通过以支撑集较小的可学习枢纽测度为条件来强制低秩传输计划。我们求解两个熵传输问题——查询到枢纽和枢纽到key——并将它们组合成一个条件耦合,该耦合可证明是双随机的,秩至多为 ,并以 时间应用于values而无需形成完整的 矩阵。枢纽位置与质量是端到端学习的。在视觉和文本基准上,LOTFormer在接入标准骨干网络(包括Swin、DeiT和BERT)时提供了强大的准确率-效率权衡。
引用
@article{arxiv.2509.23436,
title = {LOTFormer: Doubly-Stochastic Linear Attention via Low-Rank Optimal Transport},
author = {Ashkan Shahbazi and Chayne Thrash and Yikun Bai and Keaton Hamm and Navid NaderiAlizadeh and Soheil Kolouri},
journal= {arXiv preprint arXiv:2509.23436},
year = {2026}
}