学习为未见过图像数据生成卷积神经网络参数
计算机视觉与模式识别
2024-08-12 v3
摘要
典型的卷积神经网络(ConvNets)严重依赖大量图像数据,并借助迭代优化算法(如SGD或Adam)学习网络参数,这使得训练非常耗时耗资源。本文提出一种新的训练范式,并将ConvNets的参数学习表述为一个预测任务:给定ConvNet架构,我们观察到图像数据集与其对应最优网络参数之间存在相关性,并探索能否学习二者之间的超映射以捕捉关系,从而可直接预测训练阶段未出现过的图像数据集所对应的网络参数。为此,我们提出一种基于超网络的新模型PudNet,旨在学习数据集与其对应网络参数间的映射,然后通过单次前向传播为未见过的数据预测参数。此外,我们的模型得益于一系列共享权重的自适应超循环单元,以捕捉不同网络层参数间的依赖关系。大量实验表明,所提方法在两类设定下对未见过图像数据集均取得良好效果:数据集内预测与跨数据集预测。我们的PudNet也可良好扩展至大规模数据集,如ImageNet-1K。使用GC从零训练ResNet-18于ImageNet-1K需8967 GPU秒,取得44.65%的top-5准确率;而我们的PudNet仅用3.89 GPU秒预测ResNet-18网络参数,取得相当性能(44.92%),比传统训练范式快逾2300倍。
引用
@article{arxiv.2310.11862,
title = {Learning to Generate Parameters of ConvNets for Unseen Image Data},
author = {Shiye Wang and Kaituo Feng and Changsheng Li and Ye Yuan and Guoren Wang},
journal= {arXiv preprint arXiv:2310.11862},
year = {2024}
}
备注
Accepted by IEEE TIP