机器学习中的非自然算法
机器学习
2023-12-11 v1 机器学习
范畴论
摘要
自然梯度下降具有一个显著特性:在小学习率极限下,它对网络重参数化表现出不变性,从而即使对于高度协变的网络参数化也能产生稳健的训练行为。我们证明,具有这一特性的优化算法可被视为自然变换的离散近似,该自然变换从由微分同胚群(若其构形流形)决定优化器状态空间的函子,到由该群决定该状态空间切丛的函子。当用于训练参数化不佳的网络时,具有此特性的算法享有更高的效率,因为它们生成的网络演化近似于对网络重参数化不变。更具体地说,这些算法在学习率趋于零的极限下生成的流在光滑重参数化下是不变的,参数的相应流由等变映射决定。通过将此特性刻画为自然变换,我们允许推广到超越关于群作用的等变性;该框架可以解释非可逆映射(如投影),从而创建一个用于直接比较非同构网络架构间训练行为的框架,并通过考虑这些投影的逆向极限(若存在)来形式化地考察网络规模增大时的极限行为。我们引入了一种更一般地引入这种自然性的简单方法,并考察了多种流行的机器学习训练算法,发现大多数都是非自然的。
引用
@article{arxiv.2312.04739,
title = {Unnatural Algorithms in Machine Learning},
author = {Christian Goodbrake},
journal= {arXiv preprint arXiv:2312.04739},
year = {2023}
}
备注
20 pages, 0 figures