中文

随机函数下降

最优化与控制 2024-10-16 v3 机器学习 机器学习

摘要

经典的最坏情况优化理论既不能解释机器学习中优化的成功,也无助于步长选择。在本文中,我们证明了以“随机函数”框架取代经典“凸函数”框架的可行性与优势。由于复杂度为 O(n3d3)\mathcal{O}(n^3d^3)(其中 nn 为步数,dd 为维数),带梯度的贝叶斯优化迄今在大规模维度上不可行。通过弥合贝叶斯优化(即随机函数优化理论)与经典优化之间的鸿沟,我们确立了其可行性。具体而言,我们使用“随机泰勒近似”重新发现了梯度下降,因其 O(nd)\mathcal{O}(nd) 复杂度而在高维下可扩展。这一重新发现产生了一种特定的步长调度,我们称之为随机函数下降(RFD)。该随机函数框架的优势在于 RFD 具有尺度不变性,并为梯度裁剪与渐进学习率预热等常见步长启发式方法提供了理论基础。

关键词

引用

@article{arxiv.2305.01377,
  title  = {Random Function Descent},
  author = {Felix Benning and Leif Döring},
  journal= {arXiv preprint arXiv:2305.01377},
  year   = {2024}
}