拼接 ViT 是灵活的视觉骨干网络
计算机视觉与模式识别
2023-11-29 v2 人工智能
机器学习
摘要
大型预训练普通视觉 Transformer(ViT)已成为许多下游任务的主力。然而,现有利用现成 ViT 的工作在训练和部署上效率低下,因为采用不同尺寸的 ViT 需要分别训练,且受限于固定的性能-效率权衡。本文受拼接神经网络(SN-Net)启发,其是一种通过拼接预训练模型族廉价生成覆盖丰富子网络的单一模型、在运行时支持多样性能-效率权衡的新框架。在此基础之上,我们引入 SN-Netv2,一种系统性改进的模型拼接框架以促进下游任务适配。具体而言,我们首先提出双向拼接方案以扩大拼接空间。随后设计一种考虑空间中底层 FLOPs 分布的资源约束采样策略以实现更好采样。最后,我们观察到将拼接层学习为低秩更新对下游任务稳定训练和确保良好 Pareto 前沿起关键作用。在 ImageNet-1K、ADE20K、COCO-Stuff-10K 和 NYUv2 上的大量实验表明,SN-Netv2 在下游密集预测上较 SN-Netv1 性能更优,并展现出作为灵活视觉骨干网络的强大能力,在训练效率和部署灵活性上均具显著优势。代码见 https://github.com/ziplab/SN-Netv2。
引用
@article{arxiv.2307.00154,
title = {Stitched ViTs are Flexible Vision Backbones},
author = {Zizheng Pan and Jing Liu and Haoyu He and Jianfei Cai and Bohan Zhuang},
journal= {arXiv preprint arXiv:2307.00154},
year = {2023}
}
备注
Tech report