中文

面向视觉 Transformer 高效训练的自动化渐进学习

计算机视觉与模式识别 2022-03-29 v1 人工智能 机器学习

摘要

视觉 Transformer(ViT)最近的进展伴随着对计算能力的巨大需求,凸显了开发 ViT 高效训练方法的迫切性。渐进学习是一种在训练过程中模型容量逐步增长的训练方案,已开始展现其在高效训练中的能力。在本文中,我们通过定制和自动化渐进学习,向 ViT 的高效训练迈出实用一步。首先,我们为 ViT 的渐进学习开发了一个强手动基线,通过引入动量增长(MoGrow)来弥合模型增长带来的差距。然后,我们提出自动化渐进学习(AutoProg),一种旨在通过动态自动增加训练负担来实现无损加速的高效训练方案;这通过自适应决定在渐进学习中模型是否、在何处以及增长多少来实现。具体而言,我们首先将增长计划的优化放宽为子网络架构优化问题,然后提出通过弹性超网对子网络性能进行一次性估计。通过回收超网的参数,搜索开销被降至最低。在 ImageNet 上使用 DeiT 和 VOLO 两个代表性 ViT 模型进行的高效训练大量实验表明,AutoProg 可在无性能下降的情况下将 ViT 训练加速至多 85.1%。代码:https://github.com/changlin31/AutoProg

关键词

引用

@article{arxiv.2203.14509,
  title  = {Automated Progressive Learning for Efficient Training of Vision Transformers},
  author = {Changlin Li and Bohan Zhuang and Guangrun Wang and Xiaodan Liang and Xiaojun Chang and Yi Yang},
  journal= {arXiv preprint arXiv:2203.14509},
  year   = {2022}
}

备注

Accepted to CVPR 2022