不可微神经网络的解析性质
机器学习
2020-11-04 v1 最优化与控制
摘要
计算深度学习的研究已投入大量努力,通过对激活函数进行简化,或对激活值与权重进行量化,来实现面向硬件的深度神经网络优化。由此产生的网络不可微性(甚至不连续性)带来了一些具有挑战性的问题,尤其与学习过程相关。本文针对量化神经网络的表达能力以及不可微网络的逼近技术等多个问题展开研究。首先,我们肯定地回答了QNN(量化神经网络)在范数下对Lipschitz函数的逼近能力是否与DNN(深度神经网络)具有相同表达能力的问题。接着,考虑一个连续但未必可微的网络,我们描述了一种逐层随机正则化技术以产生可微逼近,并展示了这种正则化方法如何给出简洁的定量估计。最后,我们考虑由Heaviside型激活函数定义的网络,并在对正则化激活的适当假设下,证明了平滑网络对其的点态逼近结果。
引用
@article{arxiv.2011.01858,
title = {Analytical aspects of non-differentiable neural networks},
author = {Gian Paolo Leonardi and Matteo Spallanzani},
journal= {arXiv preprint arXiv:2011.01858},
year = {2020}
}