梯度流如何将 Softmax 输出极化为低熵解
机器学习
2026-03-09 v1 最优化与控制
机器学习
摘要
理解基于softmax模型的非凸训练动力学对于解释transformer的实际成功至关重要。本文分析了价值-softmax模型的梯度流动力学,该模型定义为,其中为可学习的价值矩阵,为注意力向量。由于矩阵乘以softmax向量的参数化构成了自注意力机制的核心构建模块,本文的分析直接提供了关于transformer训练动力学的见解。我们揭示了该结构上的梯度流本质上会驱动优化趋向于低熵输出解。我们证明了这种极化效应在各种目标函数上均具有普适性,包括逻辑损失与平方损失。此外,我们讨论了这些理论结果的实际意义,提供了解释注意力 sink 与大规模激活等经验现象的正式机制。
关键词
引用
@article{arxiv.2603.06248,
title = {Gradient Flow Polarizes Softmax Outputs towards Low-Entropy Solutions},
author = {Aditya Varre and Mark Rofin and Nicolas Flammarion},
journal= {arXiv preprint arXiv:2603.06248},
year = {2026}
}
备注
35 pages, 21 figures