中文

稀疏两层线性网络击败任何含全连接输入层的神经网络之一例

机器学习 2020-10-20 v1 机器学习

摘要

曾有猜想认为:任何结构、且在节点处具任意可微传递函数的神经网络,在用梯度下降训练时,都无法以样本高效的方式学习如下问题:实例为 d 维 Hadamard 矩阵的行,目标为其中一个特征,即非常稀疏。我们本质上证明了该猜想:我们表明在接收到大小为 k < d 的随机训练集后,期望平方损失仍为 1−k/(d−1)。唯一所需条件是输入层全连接,且输入节点初始权向量选自旋转不变分布。令人惊讶的是,同类问题可被简单的 2 层线性神经网络极高效地解决,其中 d 个输入通过长度为 2 的链连接到输出节点(此时输入层每个输入仅有一条边)。当此类网络用梯度下降训练时,已有结果表明其期望平方损失为 log d / k。我们的下界本质上表明:当样本数少于输入特征数时,要用梯度下降样本高效地学习稀疏目标,需要稀疏的输入层。

关键词

引用

@article{arxiv.2010.08625,
  title  = {A case where a spindly two-layer linear network whips any neural network with a fully connected input layer},
  author = {Manfred K. Warmuth and Wojciech Kotłowski and Ehsan Amid},
  journal= {arXiv preprint arXiv:2010.08625},
  year   = {2020}
}