中文

对 softmax 做对角化:Hadamard 初始化实现交叉熵动力学可计算性

机器学习 2025-12-04 v1 最优化与控制 机器学习

摘要

交叉熵(CE)训练损失主导深度学习实践,但现有理论常通过简化处理,即用平方损失替代或限制于凸模型,忽略了其本质行为。CE 与平方损失产生根本不同的动力学,凸线性模型无法捕捉非凸优化的复杂性。我们对多类 CE 优化动力学进行深入表征,分析一个标准基向量作为输入的两层线性神经网络——这是一种最简非凸模型,其隐式偏好尚未知晓。该模型与用于研究神经瓷砖的无约束特征模型一致,是首次证明 CE 的梯度流收敛至神经瓷砖几何。我们构建了一个显式的Lyapunov函数,建立全局收敛性,尽管该非凸景观中存在虚拙临界点。我们分析中的关键洞见是一种不起眼的发现:Hadamard 初始化对 softmax 进行对角化,固定权重矩阵的奇异向量,从而将动力学完全简化为其奇异值。这一技术为超越所述具体情境的 CE 训练动力学分析开辟了路径。

关键词

引用

@article{arxiv.2512.04006,
  title  = {Diagonalizing the Softmax: Hadamard Initialization for Tractable Cross-Entropy Dynamics},
  author = {Connall Garrod and Jonathan P. Keating and Christos Thrampoulidis},
  journal= {arXiv preprint arXiv:2512.04006},
  year   = {2025}
}