中文

LocoProp:通过局部损失优化增强反向传播

机器学习 2022-03-08 v2

摘要

二阶方法在优化深度神经网络方面已展现出最先进的性能。然而,与一阶方法相比,其巨大的内存需求和高计算复杂度阻碍了它们在典型低资源设置中的通用性。本文介绍了一种用于多层神经网络的逐层损失构建通用框架,该框架在仅使用一阶优化器的同时实现了接近二阶方法的性能。我们的方法基于损失、目标和正则化项的三组件组合,改变每个组件会产生新的更新规则。我们给出了使用平方损失以及由各种传递函数的凸积分函数诱导的逐层 Bregman 散度的示例。我们在基准模型和数据集上的实验验证了新方法的有效性,缩小了一阶与二阶优化器之间的差距。

关键词

引用

@article{arxiv.2106.06199,
  title  = {LocoProp: Enhancing BackProp via Local Loss Optimization},
  author = {Ehsan Amid and Rohan Anil and Manfred K. Warmuth},
  journal= {arXiv preprint arXiv:2106.06199},
  year   = {2022}
}