门控即加权:通过情境学习理解门控线性注意力
机器学习
2025-04-08 v1 人工智能
计算与语言
最优化与控制
摘要
线性注意力方法因其在递归解码中的高效性,成为softmax注意力的有力替代方案。近期研究致力于通过保留其计算优势的同时引入门控机制,以增强标准线性注意力。此类门控线性注意力(Gated Linear Attention, GLA)架构包括Mamba和RWKV等竞争性模型。本文探讨了GLA模型的情境学习能力,作出以下贡献:我们表明,多层GLA可实现一类通用的加权预条件梯度下降(Weighted Preconditioned Gradient Descent, WPGD)算法,其中数据依赖的权重由门控机制和输入数据引导,使模型能够控制 individual tokens 对预测的贡献。为进一步理解这种加权机制,我们引入一种新型数据模型,包含多任务提示,并刻画了学习WPGD算法的优化景观。在温和条件下,我们确立了全局最小值存在唯一性(至缩放),对应唯一的WPGD解。最后,我们将这些发现转化为探讨GLA的优化景观,阐明了门控如何促进情境感知学习,以及在何种情况下严格优于普通线性注意力。
引用
@article{arxiv.2504.04308,
title = {Gating is Weighting: Understanding Gated Linear Attention through In-context Learning},
author = {Yingcong Li and Davoud Ataee Tarzanagh and Ankit Singh Rawat and Maryam Fazel and Samet Oymak},
journal= {arXiv preprint arXiv:2504.04308},
year = {2025}
}