中文

神经随机梯度下降-上升法用于函数极小极大优化的平均场分析

机器学习 2024-10-25 v3 最优化与控制 机器学习

摘要

本文研究定义在过参数化两层神经网络的无限维函数类上的极小极大优化问题。特别地,我们考虑由条件期望定义的线性泛函方程估计所引发的极小极大优化问题,其中目标函数在函数空间中是二次的。我们处理(i)随机梯度下降-上升算法的收敛性和(ii)神经网络的表示学习。我们通过考虑优化动力学的连续时间和无限宽度极限,在平均场机制下建立收敛性。在该机制下,随机梯度下降-上升对应于神经网络参数空间上概率测度空间上的Wasserstein梯度流。我们证明Wasserstein梯度流以O(T1+α1)O(T^{-1} + \alpha^{-1})的次线性速率全局收敛到极小极大目标的驻点,并且当极小极大目标的正则化器是强凸时,还能找到泛函方程的解。这里TT表示时间,α\alpha是神经网络的缩放参数。在表示学习方面,我们的结果表明神经网络诱导的特征表示允许以O(α1)O(\alpha^{-1})的幅度偏离初始表示,以Wasserstein距离度量。最后,我们将我们的通用结果应用于具体例子,包括策略评估、非参数工具变量回归、资产定价和对抗性Riesz表示估计。

关键词

引用

@article{arxiv.2404.12312,
  title  = {A Mean-Field Analysis of Neural Stochastic Gradient Descent-Ascent for Functional Minimax Optimization},
  author = {Yuchen Zhu and Yufeng Zhang and Zhaoran Wang and Zhuoran Yang and Xiaohong Chen},
  journal= {arXiv preprint arXiv:2404.12312},
  year   = {2024}
}

备注

Submitted