基于高级自动化渐进学习的大型视觉模型高效训练
摘要
大型视觉模型(LVMs)如视觉 Transformer(ViT)和扩散模型的快速发展导致计算资源需求不断增加,造成巨大的经济和环境成本。这一挑战凸显了开发 LVMs 高效训练方法的必要性。渐进式学习(progressive learning)是一种在训练过程中逐步增加模型容量的策略,已显示出缓解上述挑战的潜力。本文提出一种高级自动化渐进学习(AutoProg)框架,用于高效训练 LVMs。我们首先聚焦于 LVMs 的预训练,以 ViT 为案例,提出 AutoProg-One,一种具有动量增长(MoGrow)和单次增长计划搜索的 AutoProg 方案。除了预训练之外,我们将该方法扩展到 LVMs 的迁移学习和微调。我们将 AutoProg 的应用范围拓展到更广泛的 LVMs,包括扩散模型。首先,我们引入 AutoProg-Zero,通过增强 AutoProg 框架的零射线解冻计划搜索,无需进行单次超级网络训练。其次,我们引入一种新颖的唯一阶段标识符(SID)方案,以在网络增长期间弥合差距。这些创新与 AutoProg 的核心原则相结合,为各种 LVM 场景下的高效训练提供了综合解决方案。大量实验表明,AutoProg 在 ImageNet 上的 ViT 预训练速度提升最高可达 1.85 倍,对扩散模型的微调速度提升最高可达 2.86 倍,且性能相当甚至更好。这一工作为 LVMs 的高效训练提供了稳健且可扩展的解决方案,潜在可应用于广泛的视觉任务。代码:https://github.com/changlin31/AutoProg-Zero
引用
@article{arxiv.2410.00350,
title = {Efficient Training of Large Vision Models via Advanced Automated Progressive Learning},
author = {Changlin Li and Jiawei Zhang and Sihao Lin and Zongxin Yang and Junwei Liang and Xiaodan Liang and Xiaojun Chang},
journal= {arXiv preprint arXiv:2410.00350},
year = {2024}
}
备注
Code: https://github.com/changlin31/AutoProg-Zero. arXiv admin note: substantial text overlap with arXiv:2203.14509