中文

作为混合凸-组合优化问题的深度学习

机器学习 2018-04-18 v3 计算机视觉与模式识别 神经与进化计算

摘要

随着神经网络变得更深更宽,学习具有硬阈值激活函数的网络正变得愈发重要,这既是为了网络量化(可大幅降低时间与能耗需求),也是为了创建由深度网络构成的大型集成系统(其可能含有不可微组件,且必须避免梯度消失与爆炸以实现有效学习)。然而,由于梯度下降不适用于硬阈值函数,尚不清楚如何以原则性方式学习此类网络。我们通过如下观察解决该问题:为最小化损失而为硬阈值隐藏单元设定目标是一个离散优化问题,并可据此求解。该离散优化目标是找到一组目标,使得每个单元(包括输出)都具有线性可分的问题待解。给定这些目标后,网络分解为各个感知机,随后可用标准凸方法学习。基于此,我们开发了一种递归小批量算法用于学习深度硬阈值网络,该算法将流行但缺乏依据的直通估计器作为特例包含在内。实证上,我们表明与直通估计器相比,我们的算法在若干设定下提升了分类准确率,包括ImageNet上的AlexNet和ResNet-18。

关键词

引用

@article{arxiv.1710.11573,
  title  = {Deep Learning as a Mixed Convex-Combinatorial Optimization Problem},
  author = {Abram L. Friesen and Pedro Domingos},
  journal= {arXiv preprint arXiv:1710.11573},
  year   = {2018}
}

备注

14 pages (9 body, 5 pages of references and appendices)