重参数化模型上梯度下降的隐式偏置:与镜像下降的等价性
机器学习
2022-07-11 v1 最优化与控制
摘要
作为理解过参数化模型中梯度下降隐式偏置工作的一部分,若干结果已表明如何将过参数化模型上的训练轨迹理解为在不同目标上的镜像下降。这里的主要结果是在称为交换参数化(commuting parametrization)的概念下对此现象的一种刻画,它涵盖了该设定下的所有先前结果。我们证明,具有任意交换参数化的梯度流等价于带有相关 Legendre 函数的连续镜像下降。反之,任意 Legendre 函数下的连续镜像下降可视为具有相关交换参数化的梯度流。后一结果依赖于 Nash 嵌入定理。
引用
@article{arxiv.2207.04036,
title = {Implicit Bias of Gradient Descent on Reparametrized Models: On Equivalence to Mirror Descent},
author = {Zhiyuan Li and Tianhao Wang and JasonD. Lee and Sanjeev Arora},
journal= {arXiv preprint arXiv:2207.04036},
year = {2022}
}
备注
37 pages