中文

软最大函数的前沿探索:可证明的优化、扩散模型应用及更多

机器学习 2026-01-27 v2 人工智能

摘要

softmax 激活函数在大型语言模型(LLMs)中发挥着关键作用,尤其是在广泛采用的 Transformer 架构中的自注意力机制中。然而,导致 softmax 有效性的底层学习动力学仍基本未知。为更好地理解这一问题,本文对两层 softmax 神经网络的优化和泛化性进行了理论研究,提供了其在 ReLU 和指数函数等其他激活函数方面优越性能的理论见解。利用神经切向核(NTK)框架,我们的分析揭示了 softmax 函数的归一化效应导致其诱导的 NTK 矩阵具有良好的扰动特性,从而导致损失函数景观中存在良好的凸区域。因此,在过参数化 regime 下,softmax 神经网络可以学习目标函数。为了演示所提理论发现的广泛适用性,我们将其应用于扩散模型中得分估计函数的学习任务,这是一种具有前景的生成模型方法。我们的分析表明,梯度基于算法可以以可证明的准确度学习得分函数。我们的工作提供了对 softmax 神经网络有效性的更深入理解,并为其在各个领域的潜力提供了可能,为自然语言处理及其它领域的进一步进步铺平了道路。

关键词

引用

@article{arxiv.2405.03251,
  title  = {Exploring the Frontiers of Softmax: Provable Optimization, Applications in Diffusion Model, and Beyond},
  author = {Yang Cao and Yingyu Liang and Zhenmei Shi and Zhao Song},
  journal= {arXiv preprint arXiv:2405.03251},
  year   = {2026}
}

备注

53 pages