计算机视觉模型中监督与自监督预训练的彩票假设
机器学习
2021-03-31 v2 计算机视觉与模式识别
神经与进化计算
摘要
计算机视觉界正重新燃起对各类预训练模型的热情,包括经典的 ImageNet 监督预训练与近期涌现的自监督预训练如 simCLR 和 MoCo。预训练权重常可提升包括分类、检测与分割在内的广泛下游任务。最新研究表明预训练受益于巨大模型容量。我们由此好奇并追问:预训练之后,预训练模型为保持其下游可迁移性是否确实必须维持 large?本文中,我们通过彩票假设(LTH)的视角审视监督与自监督预训练模型。LTH 识别出高度稀疏的匹配子网络,其可从(近乎)零开始独立训练却仍达到完整模型的性能。我们拓展 LTH 的范畴并质疑:在预训练计算机视觉模型中是否仍存在享有同等下游迁移性能的匹配子网络。我们大量实验传递了总体积极的讯息:从 ImageNet 分类、simCLR 与 MoCo 获得的所有预训练权重中,我们一致能在 59.04% 至 96.48% 稀疏度下定位此类匹配子网络,其可普遍迁移至多个下游任务,性能相较使用完整预训练权重未见退化。进一步分析揭示,从不同预训练找到的子网络往往产生多样的掩码结构与扰动敏感性。我们结论为核心 LTH 观测在计算机视觉预训练范式下仍普遍相关,但某些情形需更细致的探讨。代码与预训练模型将发布于:https://github.com/VITA-Group/CV_LTH_Pre-training。
引用
@article{arxiv.2012.06908,
title = {The Lottery Tickets Hypothesis for Supervised and Self-supervised Pre-training in Computer Vision Models},
author = {Tianlong Chen and Jonathan Frankle and Shiyu Chang and Sijia Liu and Yang Zhang and Michael Carbin and Zhangyang Wang},
journal= {arXiv preprint arXiv:2012.06908},
year = {2021}
}
备注
CVPR 2021