中文

基于 KL 散度的自然梯度下降收敛性质

机器学习 2025-07-31 v2 最优化与控制

摘要

克隆-莫尔(KL)散度在概率机器学习中占据核心位置,常作为标准损失函数。此类设置下的优化通常在概率单纬形上进行,参数化选择对收敛性质影响显著。本文研究最小化 KL 散度的问题,分析在信息几何框架下两种双坐标系下的梯度优化算法行为——指数族(θ\theta 坐标)和混合族(η\eta 坐标)。我们将欧几里得梯度下降(GD)在这些坐标系中与坐标无关的自然梯度下降(NGD)进行比较,后者是一种纳米几何梯度,包含底层统计模型的内在几何。连续时间中,我们证明 GD 在 θ\thetaη\eta 坐标系中的收敛速率分别提供了 NGD 收敛速率的下界和上界。此外,在双坐标系的仿射重参数化下,GD 在 η\etaθ\theta 坐标系中的收敛速率可分别缩放为 2c2c2c\frac{2}{c},其中 c>0c>0 为任意常数,而 NGD 保持固定收敛速率为 2,不受此类变换影响且位于两者之间。虽然这表明 NGD 在连续时间中可能不具备统一优越性,但我们在离散时间下演示其优势显现,实现更快的收敛和对噪声的更好鲁棒性,超越 GD。我们的分析基于对 KL 散度在最优点 Hessian 谱和条件数进行的上下界,这与 Fisher 信息矩阵相吻合。

关键词

引用

@article{arxiv.2504.19259,
  title  = {Convergence Properties of Natural Gradient Descent for Minimizing KL Divergence},
  author = {Adwait Datar and Nihat Ay},
  journal= {arXiv preprint arXiv:2504.19259},
  year   = {2025}
}

备注

replaced earlier draft with the camera-ready version published at tmlr