SGD 批量大小对自编码器学习的影响:稀疏性、锐度与特征学习
机器学习
2023-08-08 v1 机器学习
摘要
本文研究了在正交数据上训练具有线性或 ReLU 激活的单神经元自编码器时,随机梯度下降(SGD)的动力学行为。我们表明,对于这一非凸问题,以常数步长随机初始化 SGD 可对任意批量大小选择成功找到全局最小值。然而,所找到的具体全局最小值取决于批量大小。在全批量设置下,我们证明解是稠密的(即非稀疏的)且与初始化方向高度对齐,表明发生的特征学习相对较少。另一方面,对于任何严格小于样本数的批量大小,SGD 找到的全局最小值是稀疏的且几乎与初始化正交,表明随机梯度的随机性在此设置下诱导出一种定性不同的“特征选择”。此外,若以 Hessian 矩阵的迹度量最小值锐度,则全批量梯度下降找到的最小值比严格较小批量大小找到的最小值更平坦,这与先前认为大批量导致更尖锐最小值的研究相反。为证明常数步长 SGD 的收敛性,我们引入了非齐次随机游走理论中的一个有力工具,其本身可能具有独立意义。
引用
@article{arxiv.2308.03215,
title = {The Effect of SGD Batch Size on Autoencoder Learning: Sparsity, Sharpness, and Feature Learning},
author = {Nikhil Ghosh and Spencer Frei and Wooseok Ha and Bin Yu},
journal= {arXiv preprint arXiv:2308.03215},
year = {2023}
}