骨干网络之争:跨计算机视觉任务的大规模预训练模型比较
计算机视觉与模式识别
2023-11-21 v2 机器学习
摘要
基于神经网络的计算机视觉系统通常构建于一个骨干网络(backbone)之上,即一个预训练或随机初始化的特征提取器。几年前,默认选择是 ImageNet 训练的卷积神经网络。然而,近年来涌现了无数使用各种算法和数据集预训练的骨干网络。尽管这种丰富的选择带来了一系列系统性能的提升,但从业者很难就选择哪种骨干网络做出明智决定。Battle of the Backbones (BoB) 通过对一套多样化的预训练模型(包括视觉-语言模型、通过自监督学习训练的模型以及 Stable Diffusion 骨干网络)在从分类到目标检测到分布外(OOD)泛化等众多计算机视觉任务上进行基准测试,使这一选择更加容易。此外,BoB 通过在超过 1500 次训练运行上进行的综合分析,揭示现有方法的优势与不足,从而为研究界推进计算机视觉指明有前景的方向。尽管视觉 Transformer(ViT)和自监督学习(SSL)日益流行,我们发现,在我们考虑的模型中,在大型训练集上以监督方式预训练的卷积神经网络在大多数任务上仍表现最佳。而且,在相同架构和相似规模预训练数据集的公平比较中,我们发现 SSL 骨干网络极具竞争力,这表明未来的工作应使用先进架构和更大数据集进行 SSL 预训练。我们在此发布实验的原始结果以及允许研究者将自己的骨干网络投入严苛测试的代码:https://github.com/hsouri/Battle-of-the-Backbones
引用
@article{arxiv.2310.19909,
title = {Battle of the Backbones: A Large-Scale Comparison of Pretrained Models across Computer Vision Tasks},
author = {Micah Goldblum and Hossein Souri and Renkun Ni and Manli Shu and Viraj Prabhu and Gowthami Somepalli and Prithvijit Chattopadhyay and Mark Ibrahim and Adrien Bardes and Judy Hoffman and Rama Chellappa and Andrew Gordon Wilson and Tom Goldstein},
journal= {arXiv preprint arXiv:2310.19909},
year = {2023}
}
备注
Accepted to NeurIPS 2023