中文

深度卷积神经网络特征提取的数学理论

信息论 2017-10-25 v3 人工智能 机器学习 泛函分析 math.IT 机器学习

摘要

深度卷积神经网络在众多实际机器学习任务中取得了突破性成果,例如 ImageNet 数据集中的图像分类、玩 Atari 游戏或围棋的控制策略学习,以及图像描述生成。这些应用中的许多首先进行特征提取,然后将提取结果输入可训练分类器。Mallat (2012) 开启了用于特征提取的深度卷积神经网络的数学分析。具体而言,Mallat 考虑了基于小波变换后接每个网络层中模非线性的所谓散射网络,并证明了相应特征提取器的平移不变性(在小波尺度参数渐近意义下)和形变稳定性。本文通过发展一个涵盖一般卷积变换(更技术地说,一般半离散框架,包括 Weyl-Heisenberg 滤波器、曲线波、剪切波、脊波、小波和学习滤波器)、一般 Lipschitz 连续非线性(如修正线性单元、移位逻辑 sigmoid、双曲正切和模函数)以及一般 Lipschitz 连续池化算子(例如子采样和平均)来补充 Mallat 的结果。此外,这些元素在不同网络层中可以各不相同。对于所得到的特征提取器,我们证明了一个垂直方向的平移不变性结果,即特征随网络深度增加而逐渐变得更加平移不变,并建立了适用于信号类别(如带限函数、卡通函数和 Lipschitz 函数)的形变敏感度界。

关键词

引用

@article{arxiv.1512.06293,
  title  = {A Mathematical Theory of Deep Convolutional Neural Networks for Feature Extraction},
  author = {Thomas Wiatowski and Helmut Bölcskei},
  journal= {arXiv preprint arXiv:1512.06293},
  year   = {2017}
}

备注

IEEE Transactions on Information Theory, to appear