具有一般激活函数的深度平衡模型的全局收敛速率
机器学习
2025-02-14 v4 机器学习
摘要
在近期一篇论文中,Ling等人研究了带ReLU激活函数的过参数化深度平衡模型(DEQ)。他们证明了对于二次损失函数,梯度下降以线性收敛速率收敛至全局最优解。本文表明,对于具有有界一阶与二阶导数的任意一般激活函数的DEQ,该结论依然成立。由于新的激活函数一般为非齐次的,对平衡点的Gram矩阵最小特征值进行界定尤为困难。为完成此任务,我们需要构造一种新颖的总体Gram矩阵,并借助Hermite多项式展开发展一种新形式的对偶激活。
引用
@article{arxiv.2302.05797,
title = {Global Convergence Rate of Deep Equilibrium Models with General Activations},
author = {Lan V. Truong},
journal= {arXiv preprint arXiv:2302.05797},
year = {2025}
}
备注
Accepted to TMLR