ZeroS:高效 Transformer 的零和线性注意力
机器学习
2026-02-06 v1 人工智能
机器学习
摘要
线性注意力方法为 Transformer 提供 的复杂度,但通常表现不如标准 softmax 注意力。在此基础上,我们确定影响这些方法的两个根本性限制:仅允许加法性信息融合的凸组合限制,以及在长序列上下文中均匀累积权重偏置的稀释效应。我们提出零和线性注意力 (ZeroS),通过消除常数零阶项 并对剩余的零和 softmax 残差进行重新加权来解决这些限制。此修改创建了数学上稳定的权重,使其能够正负取值,从而使单个注意力层能够执行对比操作。虽然保持 的复杂度,ZeroS 在理论上扩展了相对于凸组合可表示函数的集合。实验方面,它在各种序列建模基准测试中与标准 softmax 注意力相当或更好。
关键词
引用
@article{arxiv.2602.05230,
title = {ZeroS: Zero-Sum Linear Attention for Efficient Transformers},
author = {Jiecheng Lu and Xu Han and Yan Sun and Viresh Pati and Yubin Kim and Siddhartha Somani and Shihao Yang},
journal= {arXiv preprint arXiv:2602.05230},
year = {2026}
}
备注
Camera-ready version. Accepted at NeurIPS 2025