减少反向传播需求并通过神经网络显式优化发现更优极值
机器学习
2023-11-14 v1 概率论
数据分析、统计与概率
机器学习
摘要
依赖反向传播的迭代微分近似方法已实现神经网络的优化;然而目前其计算开销仍大,尤其在大规模训练模型时。本文提出一种计算高效的神经网络优化替代方案,既能降低神经网络规模化的成本,又能为低资源应用提供高效优化。我们通过数学分析简单前馈语言模型(LM)的梯度,导出其显式解。该解从单层 LM 推广至一类在所有正特征值上训练的单层前馈 softmax 激活神经模型,正如我们将此解应用于 MNIST 数字分类所展示。对于 LM 与数字分类器,我们计算实验发现显式解近乎最优:1)迭代优化仅边际改善显式解参数;2)随机初始化参数经迭代优化趋向显式解。我们还初步将显式解按层局部应用于多层网络,并讨论随着模型复杂度增加该解的计算节省——对于显式解的单层与多层应用,我们强调所达极值无法仅由反向传播达到,即更优极值似乎仅在应用显式解后才可被发掘。最后,我们讨论该解的计算节省及其对模型可解释性的影响,并建议未来推导复杂与多层架构显式解的方向。
引用
@article{arxiv.2311.07498,
title = {Reducing the Need for Backpropagation and Discovering Better Optima With Explicit Optimizations of Neural Networks},
author = {Jake Ryland Williams and Haoran Zhao},
journal= {arXiv preprint arXiv:2311.07498},
year = {2023}
}