中文

ZeroS:高效 Transformer 的零和线性注意力

机器学习 2026-02-06 v1 人工智能 机器学习

摘要

线性注意力方法为 Transformer 提供 O(N)O(N) 的复杂度,但通常表现不如标准 softmax 注意力。在此基础上,我们确定影响这些方法的两个根本性限制:仅允许加法性信息融合的凸组合限制,以及在长序列上下文中均匀累积权重偏置的稀释效应。我们提出零和线性注意力 (ZeroS),通过消除常数零阶项 1/t1/t 并对剩余的零和 softmax 残差进行重新加权来解决这些限制。此修改创建了数学上稳定的权重,使其能够正负取值,从而使单个注意力层能够执行对比操作。虽然保持 O(N)O(N) 的复杂度,ZeroS 在理论上扩展了相对于凸组合可表示函数的集合。实验方面,它在各种序列建模基准测试中与标准 softmax 注意力相当或更好。

关键词

引用

@article{arxiv.2602.05230,
  title  = {ZeroS: Zero-Sum Linear Attention for Efficient Transformers},
  author = {Jiecheng Lu and Xu Han and Yan Sun and Viresh Pati and Yubin Kim and Siddhartha Somani and Shihao Yang},
  journal= {arXiv preprint arXiv:2602.05230},
  year   = {2026}
}

备注

Camera-ready version. Accepted at NeurIPS 2025