中文

在未知网络架构前预训练神经网络

计算机视觉与模式识别 2022-07-21 v1 人工智能 机器学习

摘要

通过训练一个较小的超网络(hypernetwork)来预测大型网络的参数,训练大型神经网络成为可能。最近发布的Graph HyperNetwork(GHN)以这种方式在一百万个较小的ImageNet架构上训练,能够预测如ResNet-50等大型未见网络的参数。虽然具有预测参数的网络在源任务上性能下降,但发现预测参数对在其他任务上微调有用。我们研究基于同一GHN的微调在GHN训练后发布的新型强架构上是否仍然有用。我们发现,对于ConvNeXt等近期架构,GHN初始化不如对ResNet-50有用。一个潜在原因是新型架构与用于训练GHN的架构之间的分布偏移增大。我们还发现预测参数缺乏通过梯度下降成功微调参数所必需的多样性。我们通过在将预测参数微调到目标任务之前对其应用简单的后处理技术来缓解这一限制,并改进了ResNet-50和ConvNeXt的微调。

关键词

引用

@article{arxiv.2207.10049,
  title  = {Pretraining a Neural Network before Knowing Its Architecture},
  author = {Boris Knyazev},
  journal= {arXiv preprint arXiv:2207.10049},
  year   = {2022}
}

备注

Accepted at ICML 2022 Workshop on Pre-training: Perspectives, Pitfalls, and Paths Forward, source code is available at https://github.com/facebookresearch/ppuda