面向迁移学习及更广泛场景的高效ConvBN块
人工智能
2024-02-29 v2
摘要
卷积-批归一化(ConvBN)块是各类计算机视觉任务及其他领域中的组成部分。ConvBN 块可以三种模式运行:训练(Train)、评估(Eval)和部署(Deploy)。虽然训练模式对于从头训练模型不可或缺,评估模式适用于迁移学习及更广泛场景,而部署模式专为模型部署设计。本文关注 ConvBN 块中稳定性与效率的权衡:部署模式高效但存在训练不稳定问题;评估模式广泛用于迁移学习但缺乏效率。为解决该困境,我们从理论上揭示了部署模式中所观察到的训练稳定性下降的原因。随后,我们提出一种新颖的调优(Tune)模式以弥合评估模式与部署模式之间的差距。所提出的 Tune 模式在迁移学习中与 Eval 模式一样稳定,且其计算效率接近 Deploy 模式。通过在 个数据集和 个模型架构上开展目标检测、分类和对抗样本生成的广泛实验,我们证明了所提出的 Tune 模式在保持性能的同时显著减少了 GPU 显存占用和训练时间,从而为迁移学习及更广泛场景贡献了高效的 ConvBN 块。我们的方法已集成到 PyTorch(通用机器学习框架)以及 MMCV/MMEngine(计算机视觉框架)中。得益于 PyTorch 内置的机器学习编译器,实践者仅需一行代码即可使用我们的高效 ConvBN 块。
引用
@article{arxiv.2305.11624,
title = {Efficient ConvBN Blocks for Transfer Learning and Beyond},
author = {Kaichao You and Guo Qin and Anchang Bao and Meng Cao and Ping Huang and Jiulong Shan and Mingsheng Long},
journal= {arXiv preprint arXiv:2305.11624},
year = {2024}
}
备注
ICLR 2024, camera ready version