POA:一次性预训练适用于所有尺寸模型
计算机视觉与模式识别
2024-08-05 v1
摘要
大规模自监督预训练为一种基础模型处理多种不同视觉任务铺平了道路。大多数预训练方法一次训练单一特定尺寸的模型。然而,现实世界场景中的各种计算或存储约束需要大量努力来开发一系列不同尺寸的模型以进行部署。因此,本研究提出了一种新颖的三分支自监督训练框架,即 POA(Pre-training Once for All),以解决上述问题。我们的方法在现代自蒸馏范式中引入了一个创新的弹性学生分支。在每个预训练步骤中,我们从原始学生网络中随机采样一个子网络来形成弹性学生,并以自蒸馏方式训练所有分支。一旦预训练完成,POA 允许提取用于下游任务的多种尺寸的预训练模型。值得注意的是,弹性学生促进了不同尺寸模型的同步预训练,同时也充当了不同尺寸模型的额外集成以增强表示学习。大量实验,包括 k 近邻、线性探测评估以及多项下游任务评估,证明了 POA 的有效性和优势。它在使用 ViT、Swin Transformer 和 ResNet 主干的条件下达到了最先进性能,通过单次预训练会话生成了约一百种不同尺寸的模型。代码可在 https://github.com/Qichuzyy/POA 获取。
引用
@article{arxiv.2408.01031,
title = {POA: Pre-training Once for Models of All Sizes},
author = {Yingying Zhang and Xin Guo and Jiangwei Lao and Lei Yu and Lixiang Ru and Jian Wang and Guo Ye and Huimei He and Jingdong Chen and Ming Yang},
journal= {arXiv preprint arXiv:2408.01031},
year = {2024}
}
备注
Accepted by ECCV2024