价值-状态门控注意力:用于缓解 Transformer 中的极端 token 现象
机器学习
2026-01-27 v3 人工智能
摘要
基于 Transformer 架构的大模型容易受到极端 token 现象的影响,如注意力沉底(attention sinks)和值状态枯竭(value-state drains)。这些问题会降低模型性能、量化保真度和可解释性,源于模型通过聚焦于接近零值状态的 token 学习到低效“无操作”行为所产生的异常相互强化机制。本文提出价值-状态门控注意力(Value-State Gated Attention, VGA),这是一种简单、专门且稳定的架构机制,用于高效地执行“无操作”注意力。VGA 引入一个可学习、数据依赖的门控机制,直接基于值向量(V)计算,以调制输出。通过对底层梯度的理论分析,我们展示,使用对自身函数的门控值-状态比以前基于输入嵌入进行的门控方法更有效地实现了值和注意力得分的解耦。这创造了一个直接的调节通道,允许模型根据其新兴的值表示抑制某个 token 的贡献。我们的实验表明,VGA 显著缓解了注意力沉底的形成,稳定了值状态范数,从而在性能、鲁棒量化保真度和模型可解释性方面取得改进。
关键词
引用
@article{arxiv.2510.09017,
title = {Value-State Gated Attention for Mitigating Extreme-Token Phenomena in Transformers},
author = {Rui Bu and Haofeng Zhong and Wenzheng Chen and Yangyan Li},
journal= {arXiv preprint arXiv:2510.09017},
year = {2026}
}