中文

仅训练 BatchNorm:论 CNN 中随机特征的表征能力

机器学习 2021-03-23 v3 人工智能 神经与进化计算 机器学习

摘要

从风格迁移到多任务学习,多种深度学习技术依赖于训练特征的仿射变换。其中最突出的是流行的特征归一化技术 BatchNorm,它归一化激活值并随后应用学习到的仿射变换。本文旨在理解以这种方式变换特征的仿射参数的作用与表征能力。为了将这些参数的贡献与其所变换的学习特征的贡献分离开来,我们研究了仅训练 BatchNorm 中这些参数并将所有权重冻结在其随机初始化值时的性能。考虑到此类训练方式施加的显著限制,这样做带来了令人惊讶的高性能。例如,足够深的 ResNet 在此配置下达到 82%(CIFAR-10)和 32%(ImageNet,top-5)准确率,远高于在网络其他位置训练同等数量随机选中参数时的表现。BatchNorm 实现此性能的部分途径是自然学会禁用约三分之一的随机特征。这些结果不仅凸显了深度学习中仿射参数的表征能力,而且在更广泛的意义上刻画了仅通过平移和缩放随机特征构建的神经网络的表征能力。

关键词

引用

@article{arxiv.2003.00152,
  title  = {Training BatchNorm and Only BatchNorm: On the Expressive Power of Random Features in CNNs},
  author = {Jonathan Frankle and David J. Schwab and Ari S. Morcos},
  journal= {arXiv preprint arXiv:2003.00152},
  year   = {2021}
}

备注

Published in ICLR 2021