利用凸性求解分类问题的块坐标下降优化器
机器学习
2020-06-19 v1 机器学习
摘要
二阶优化器在深度学习中具有引人关注的潜力,但与基于梯度的方法相比,其计算成本更高且对损失曲面非凸性更敏感。我们引入一种坐标下降方法来训练用于分类任务的深度神经网络,该方法利用了线性层权重下交叉熵损失的全局凸性。我们的混合牛顿/梯度下降(NGD)方法与将隐藏层视为提供自适应基、线性层视为提供基对数据的最优拟合这一解释一致。通过在寻找线性层全局最优参数的二阶方法与训练隐藏层的梯度下降之间交替,我们确保了自适应基在整个训练过程中对数据的最优拟合。二阶步骤中 Hessian 矩阵的大小仅随线性层权重数量缩放,而不随隐藏层的深度和宽度缩放;此外,该方法适用于任意隐藏层架构。先前将此种自适应基视角应用于回归问题的工作已展现出在降低训练成本的同时显著提高了精度,而本工作可视为该方法向分类问题的扩展。我们首先证明所得 Hessian 矩阵为对称半正定,且牛顿步实现全局极小化。通过研究人造二维点云数据的分类,我们展示了验证误差的改善以及用 NGD 训练时隐藏层所编码基函数的显著定性差异。对稠密与卷积架构的图像分类基准的应用揭示了训练精度的提升,暗示二阶方法相对梯度下降可能具有优势。
引用
@article{arxiv.2006.10123,
title = {A block coordinate descent optimizer for classification problems exploiting convexity},
author = {Ravi G. Patel and Nathaniel A. Trask and Mamikon A. Gulian and Eric C. Cyr},
journal= {arXiv preprint arXiv:2006.10123},
year = {2020}
}
备注
10 pages, 4 figures