$\mathcal{G}$-SGD:在正尺度不变空间中优化 ReLU 神经网络
机器学习
2021-03-24 v8 机器学习
摘要
众所周知,具有修正线性单元(ReLU)激活函数的神经网络是正尺度不变的。随机梯度下降等传统算法在权重的向量空间中优化神经网络,然而该空间并非正尺度不变的。这种不匹配可能导致优化过程中的问题。那么,一个自然的问题是:我们能否构造一个新的正尺度不变且足以表示 ReLU 神经网络的向量空间,以更好地促进优化过程?在本文中,我们对此问题给出了肯定的回答。首先,我们对构成变换群(记为 )的正缩放算子进行形式化研究。我们证明神经网络中一条路径(即沿该路径权重的乘积)的值对正缩放是不变的,并证明在所有路径的值向量在温和条件下足以表示神经网络。其次,我们证明可以从所有路径中识别出一些基路径,并证明它们的值向量的线性张成(记为 -空间)是在正缩放群下具有更低维度的不变空间。最后,我们设计 -空间中的随机梯度下降算法(缩写为 -SGD),通过利用反向传播以极小的额外代价优化神经网络基路径的值向量。我们的实验表明,-SGD 在基准数据集上优化 ReLU 网络时显著优于传统 SGD 算法。
引用
@article{arxiv.1802.03713,
title = {$\mathcal{G}$-SGD: Optimizing ReLU Neural Networks in its Positively Scale-Invariant Space},
author = {Qi Meng and Shuxin Zheng and Huishuai Zhang and Wei Chen and Zhi-Ming Ma and Tie-Yan Liu},
journal= {arXiv preprint arXiv:1802.03713},
year = {2021}
}