Sinkhorn 双准 stochastic 注意力秩衰减分析
机器学习
2026-04-10 v1 人工智能
最优化与控制
摘要
自注意力机制是 Transformer 架构成功的核心因素。然而,标准的行准 stochastic 注意力已被证明会在网络层之间引起显著的信号衰减。特别是,它可能导致秩消失,结果是 token 表示逐渐趋于均匀,同时导致熵消失,表现为注意力分布高度集中。最近的研究突出了双准 stochastic 注意力的优势,作为熵正则化形式,促进更平衡的注意力分布并实现更好的实证性能。在本文中,我们研究了网络深度上的秩消失现象,表明使用 Sinkhorn 算法归一化的双准 stochastic 注意力矩阵比标准 Softmax 行准 stochastic 注意力矩阵更有效地保持了秩。如前所述,跳过连接对于缓解秩消失至关重要。我们在情感分析和图像分类任务上进行了实证验证。此外,我们推导出使用 Sinkhorn 归一化进行纯自注意力秩衰减的理论上界,发现秩随深度双指数衰减到 1,这一现象此前已被证明适用于 Softmax。
引用
@article{arxiv.2604.07925,
title = {Sinkhorn doubly stochastic attention rank decay analysis},
author = {Michela Lapenna and Rita Fioresi and Bahman Gharesifard},
journal= {arXiv preprint arXiv:2604.07925},
year = {2026}
}