中文

主成分网络:训练早期实现参数缩减

机器学习 2020-06-25 v1 神经与进化计算 机器学习

摘要

近期研究表明,过参数化网络中包含小型子网络,这些子网络在单独训练时能与完整模型展现出相当的精度。这些结果凸显了在不牺牲泛化性能的前提下降低深度神经网络训练成本的潜力。然而,现有的寻找这些小型网络的方法依赖于昂贵的多次训练-剪枝流程,对于大型数据集和模型而言并不实用。在本文中,我们展示了如何找到在仅训练几个周期后便与其过参数化对应网络表现相同的小型网络。我们发现,过参数化网络中的隐藏层激活主要存在于小于实际模型宽度的子空间中。基于这一观察,我们使用 PCA 为层输入寻找高方差基,并利用这些方向表示层权重。我们剔除所有与所发现的 PCA 基无关的权重,并将此类网络架构称为主成分网络(Principal Component Networks, PCN)。在 CIFAR-10 和 ImageNet 上,我们表明 PCN 比过参数化模型训练更快、能耗更低,且精度无损失。我们发现,我们的变换带来了参数最多减少 23.8 倍的网络,且最终模型精度相等或更高——在某些情况下我们观察到最高 3% 的提升。我们还表明,ResNet-20 PCN 在训练更快的同时优于深层 ResNet-110 网络。

关键词

引用

@article{arxiv.2006.13347,
  title  = {Principal Component Networks: Parameter Reduction Early in Training},
  author = {Roger Waleffe and Theodoros Rekatsinas},
  journal= {arXiv preprint arXiv:2006.13347},
  year   = {2020}
}