我们能否扩展Transformer以预测多样化ImageNet模型的参数?
机器学习
2023-06-01 v2 人工智能
计算机视觉与模式识别
机器学习
摘要
在大型数据集上预训练神经网络正成为机器学习中的基石,但仅有少数具备大量资源的团队能够企及。我们旨在实现一个雄心勃勃的目标:使预训练民主化。为此,我们训练并发布了一个单一的神经网络,该网络能够预测其他神经网络的高质量ImageNet参数。通过使用预测参数进行初始化,我们得以加速PyTorch中可用的多样化ImageNet模型的训练。迁移到其他数据集时,以预测参数初始化的模型也收敛更快,并达到具有竞争力的终极性能。
引用
@article{arxiv.2303.04143,
title = {Can We Scale Transformers to Predict Parameters of Diverse ImageNet Models?},
author = {Boris Knyazev and Doha Hwang and Simon Lacoste-Julien},
journal= {arXiv preprint arXiv:2303.04143},
year = {2023}
}
备注
ICML 2023, camera ready (7 tables with extra results added), code and models are at https://github.com/SamsungSAILMontreal/ghn3