线性注意力:高效的双向序列建模框架
机器学习
2025-10-01 v2 人工智能
摘要
线性Transformer和状态空间模型(S State Space Models)已成为softmax Transformer在因果序列建模中的高效替代方案,能够通过矩阵乘法实现并行训练并实现类RNN的高效推理。然而,尽管它们在因果任务中取得成功,尚无统一框架将线性Transformer扩展到双向序列建模。我们提出LION——首个系统性地将线性Transformer扩展到双向设置的框架。LION将因果情况下常用的三种核心表示——全线性注意力、双向RNN和块状并行形式——推广到双向设置。这些形式在理论上等价,使模型能够在训练和推理期间发挥各自优势。我们证明了广泛的线性Transformer类都可通过LION实现,并通过三种基于衰减类型选择的核心示例进行验证:LION-LIT(双向扩展版arXiv:2006.16236);LION-D(基于arXiv:2307.08621);LION-S(采用选择性衰减的变体,arXiv:2103.02143, arXiv:2312.0075)。在标准双向任务上,LION使模型能够匹配或超越softmax Transformer的性能,同时在训练速度和推理效率上显著优于现有状态空间模型。
引用
@article{arxiv.2502.16249,
title = {Linear Attention for Efficient Bidirectional Sequence Modeling},
author = {Arshia Afzal and Elias Abad Rocamora and Leyla Naz Candogan and Pol Puigdemont and Francesco Tonin and Yongtao Wu and Mahsa Shoaran and Volkan Cevher},
journal= {arXiv preprint arXiv:2502.16249},
year = {2025}
}
备注
Accepted in NeurIPS 2025