基于 KL 散度的自然梯度下降收敛性质
机器学习
2025-07-31 v2 最优化与控制
摘要
克隆-莫尔(KL)散度在概率机器学习中占据核心位置,常作为标准损失函数。此类设置下的优化通常在概率单纬形上进行,参数化选择对收敛性质影响显著。本文研究最小化 KL 散度的问题,分析在信息几何框架下两种双坐标系下的梯度优化算法行为——指数族( 坐标)和混合族( 坐标)。我们将欧几里得梯度下降(GD)在这些坐标系中与坐标无关的自然梯度下降(NGD)进行比较,后者是一种纳米几何梯度,包含底层统计模型的内在几何。连续时间中,我们证明 GD 在 和 坐标系中的收敛速率分别提供了 NGD 收敛速率的下界和上界。此外,在双坐标系的仿射重参数化下,GD 在 和 坐标系中的收敛速率可分别缩放为 和 ,其中 为任意常数,而 NGD 保持固定收敛速率为 2,不受此类变换影响且位于两者之间。虽然这表明 NGD 在连续时间中可能不具备统一优越性,但我们在离散时间下演示其优势显现,实现更快的收敛和对噪声的更好鲁棒性,超越 GD。我们的分析基于对 KL 散度在最优点 Hessian 谱和条件数进行的上下界,这与 Fisher 信息矩阵相吻合。
引用
@article{arxiv.2504.19259,
title = {Convergence Properties of Natural Gradient Descent for Minimizing KL Divergence},
author = {Adwait Datar and Nihat Ay},
journal= {arXiv preprint arXiv:2504.19259},
year = {2025}
}
备注
replaced earlier draft with the camera-ready version published at tmlr