中文

深度卷积网络中归纳偏置的理论分析

机器学习 2024-01-23 v2 机器学习

摘要

在本文中,我们对卷积神经网络(CNNs)中的归纳偏置进行了理论分析。我们首先考察CNNs的普适性,即逼近任意连续函数的能力。我们证明深度为O(logd)\mathcal{O}(\log d)足以使深度CNNs实现该普适性,其中dd为输入维度。此外,我们确定用CNNs学习稀疏函数仅需O~(log2d)\widetilde{\mathcal{O}}(\log^2d)个样本,表明深度CNNs能够高效捕捉{\em 长程}稀疏关联。这些结果得益于在增加网络深度时多通道与下采样的全新结合。我们还深入探究了CNNs中权值共享与局部性的不同作用。为此,我们在简单回归任务上比较了CNNs、局部连接网络(LCNs)和全连接网络(FCNs)的性能,其中LCNs可视为无权重共享的CNNs。一方面,我们证明LCNs需要Ω(d){\Omega}(d)个样本而CNNs仅需O~(log2d)\widetilde{\mathcal{O}}(\log^2d)个样本,凸显了权值共享的关键作用。另一方面,我们证明FCNs需要Ω(d2)\Omega(d^2)个样本,而LCNs仅需O~(d)\widetilde{\mathcal{O}}(d)个样本,强调了局部性的重要性。这些可证明的分离量化了两种偏置之间的差异,且我们证明背后的主要观察是权值共享与局部性在学习过程中打破了不同的对称性。

关键词

引用

@article{arxiv.2305.08404,
  title  = {Theoretical Analysis of Inductive Biases in Deep Convolutional Networks},
  author = {Zihao Wang and Lei Wu},
  journal= {arXiv preprint arXiv:2305.08404},
  year   = {2024}
}

备注

57 pages