无需训练的视觉Transformer自动缩放
机器学习
2022-03-01 v2 计算机视觉与模式识别
摘要
本工作旨在实现 Vision Transformers (ViTs) 的自动化设计与缩放。动机源于两个痛点:1) 缺乏高效且原则性的 ViT 设计与缩放方法;2) ViT 的训练计算成本远高于其卷积对应模型。为解决这些问题,我们提出 As-ViT,一种无需训练的 ViT 自动缩放框架,以高效且原则性的方式自动发现并放大 ViT。具体而言,我们首先利用免训练搜索过程设计出一个“种子” ViT 拓扑。这一极速搜索通过对 ViT 网络复杂度的全面研究得以实现,与真实精度呈现出强 Kendall-tau 相关性。其次,从“种子”拓扑出发,我们通过向不同 ViT 层增加宽度/深度来自动化 ViT 的缩放规则,从而在单次运行中产生一系列参数量不同的架构。最后,基于 ViT 在训练早期可容忍粗粒度 tokenization 的观察,我们提出渐进式 tokenization 策略,以更快更省地训练 ViT。作为一个统一框架,As-ViT 在分类(ImageNet-1k 上 top1 83.5%)与检测(COCO 上 mAP 52.7%)上取得了强劲性能,且无需任何手工设计或缩放 ViT 架构:端到端模型设计与缩放过程仅在一块 V100 GPU 上耗时 12 小时。我们的代码见 https://github.com/VITA-Group/AsViT。
引用
@article{arxiv.2202.11921,
title = {Auto-scaling Vision Transformers without Training},
author = {Wuyang Chen and Wei Huang and Xianzhi Du and Xiaodan Song and Zhangyang Wang and Denny Zhou},
journal= {arXiv preprint arXiv:2202.11921},
year = {2022}
}
备注
ICLR 2022 accepted