像 (Var)Pro 一样训练:基于变量投影的高效神经网络训练
机器学习
2021-04-21 v2 数值分析
数值分析
最优化与控制
机器学习
摘要
深度神经网络(DNN)在各种传统机器学习任务中取得了 SOTA 性能,例如语音识别、图像分类和分割。DNN 高效逼近高维函数的能力也促使它们在科学应用中得到使用,例如求解偏微分方程(PDE)和生成代理模型。在本文中,我们考虑了上述许多应用中出现的 DNN 监督训练。我们聚焦于优化给定 DNN 权重以使其准确逼近观测输入与目标数据之间关系的核心问题。由于权重数量庞大、非凸性、数据稀疏以及超参数的非平凡选择,为该优化问题设计有效的求解器极具挑战性。为了更高效地求解该优化问题,我们提出使用变量投影(VarPro),这是一种最初为可分非线性最小二乘问题设计的方法。我们的主要贡献是 Gauss-Newton VarPro 方法(GNvpro),它将 VarPro 思想的适用范围扩展到了非二次目标函数,尤其是分类中出现的交叉熵损失函数。这些扩展使得 GNvpro 适用于所有涉及最后一层为仿射映射的 DNN 的训练问题,这在许多 SOTA 架构中很常见。在我们来自代理建模、分割和分类的四个数值实验中,GNvpro 比常用的随机梯度下降(SGD)方案更高效地解决了优化问题。此外,GNvpro 找到的解具有良好的泛化能力,在除一个示例外的所有示例中,对未见数据点的表现均优于经过良好调优的 SGD 方法。
引用
@article{arxiv.2007.13171,
title = {Train Like a (Var)Pro: Efficient Training of Neural Networks with Variable Projection},
author = {Elizabeth Newman and Lars Ruthotto and Joseph Hart and Bart van Bloemen Waanders},
journal= {arXiv preprint arXiv:2007.13171},
year = {2021}
}
备注
33 pages, 14 figures, 3 tables