中文

核均值偏差(Kernel Mean Discrepancy)Wasserstein梯度流的定量收敛性分析

偏微分方程分析 2026-03-03 v1 机器学习 最优化与控制

摘要

我们研究核均值偏差(KMD)(亦称最大均值偏差(MMD))泛函的Wasserstein梯度流的定量收敛性。我们的设定在 particular 案例中涵盖了浅层神经网络在无限宽度和连续时间极限下的训练动力学,以及在均场和过阻尼极限下具有两两里斯核相互作用的相互作用粒子系统。我们的主要分析关注由平方索伯维尔距离 Esν(μ)=12μνH˙s2 \mathscr{E}^{\nu}_{s}(\mu)= \frac{1}{2}\lVert \mu-\nu \rVert_{\dot H^{-s}}^{2} 表示的KMD泛函的模型情况,其中 s1s\geq 1ν\nudd维 torus 上的固定概率测度。首先,受2D-Euler方程Yudovich理论启发,我们在自然弱正则性类中建立存在性和唯一性。接下来,我们指出对于 s=1s=1,该流在最小假设下以全局指数收敛率收敛,而对于 s>1s>1,我们证明局部收敛以明确依赖于 ss 以及 μ\muν\nu 的索伯维尔正则性的多项式收敛率。这些收敛率在能量层面和更高正则性类中都成立,且对于均匀 ν\nu 为紧。我们随后考虑浅层神经网络中使用ReLU激活函数的种群损失梯度流,可表述为Sd\mathbb{S}^d上非负测度空间上的Wasserstein--Fisher--Rao梯度流。利用与索伯维尔能量情形中 s=(d+3)/2s=(d+3)/2 的对应关系,我们推导出该动力学的显式多项式局部收敛率。除 s=1s=1 的特殊情况外,在上述所有情形中,甚至非定量收敛性此前都是开放的。我们还包括维度 d=1d=1 中的数值实验,使用PDE和粒子方法说明我们的分析。

关键词

引用

@article{arxiv.2603.01977,
  title  = {Quantitative Convergence of Wasserstein Gradient Flows of Kernel Mean Discrepancies},
  author = {Lénaïc Chizat and Maria Colombo and Roberto Colombo and Xavier Fernández-Real},
  journal= {arXiv preprint arXiv:2603.01977},
  year   = {2026}
}