ElasticViT:面向多样移动设备部署快速视觉变换器的冲突感知超网训练
计算机视觉与模式识别
2023-03-22 v2
摘要
神经架构搜索(NAS)在自动设计超过 1G FLOPs 的视觉变换器(ViT)方面已展现出良好性能。然而,为多样移动设备设计轻量且低延迟的 ViT 模型仍是一大挑战。本工作中,我们提出 ElasticViT,一种两阶段 NAS 方法,其在支持广泛移动设备的超大搜索空间上训练高质量 ViT 超网,然后搜索最优子网络(子网)以直接部署。然而,先前依赖均匀采样的超网训练方法存在梯度冲突问题:采样的子网可能具有差异巨大的模型尺寸(如 50M 对比 2G FLOPs),导致优化方向不同且性能不佳。为应对该挑战,我们提出两种新颖采样技术:复杂度感知采样和性能感知采样。复杂度感知采样限制相邻训练步骤间采样子网的 FLOPs 差异,同时覆盖搜索空间中不同尺寸的子网。性能感知采样进一步选择精度良好的子网,可减少梯度冲突并提升超网质量。我们发现的模型 ElasticViT 模型在 ImageNet 上从 60M 到 800M FLOPs 取得 67.2% 到 80.0% 的 top-1 精度而无需额外重训练,在精度和延迟上均优于所有先前的 CNN 与 ViT。我们的微小和小模型也是首批在移动设备上以显著更低延迟超越最先进 CNN 的 ViT 模型。例如,ElasticViT-S1 比 EfficientNet-B0 快 2.62 倍且精度高 0.1%。
引用
@article{arxiv.2303.09730,
title = {ElasticViT: Conflict-aware Supernet Training for Deploying Fast Vision Transformer on Diverse Mobile Devices},
author = {Chen Tang and Li Lyna Zhang and Huiqiang Jiang and Jiahang Xu and Ting Cao and Quanlu Zhang and Yuqing Yang and Zhi Wang and Mao Yang},
journal= {arXiv preprint arXiv:2303.09730},
year = {2023}
}