FocusFormer:通过架构采样器聚焦于所需架构
计算机视觉与模式识别
2022-08-24 v1 人工智能
机器学习
摘要
视觉 Transformer(ViTs)支撑了计算机视觉近期的突破。然而,设计 ViT 架构费力且严重依赖专家知识。为使设计过程自动化并兼顾部署灵活性,一次性神经架构搜索将超网训练与面向多样部署场景的架构专门化解耦。为应对超网中数量庞大的子网络,现有方法将所有架构视为同等重要,并在训练的每个更新步中随机采样其中一部分。在架构搜索期间,这些方法聚焦于寻找性能与资源消耗 Pareto 前沿上的架构,这在训练与部署间形成鸿沟。本文中,我们设计了一种简单而有效的方法,称为 FocusFormer,以弥合该鸿沟。为此,我们提出学习一个架构采样器,在超网训练期间为不同资源约束下 Pareto 前沿上的那些架构分配更高的采样概率,使其得到充分优化从而提升性能。在专门化阶段,我们可直接使用训练良好的架构采样器获得满足给定资源约束的精确架构,显著提高了搜索效率。在 CIFAR-100 和 ImageNet 上的大量实验表明,我们的 FocusFormer 能够在显著降低搜索成本的同时提升被搜索架构的性能。例如在 ImageNet 上,我们 1.4G FLOPs 的 FocusFormer-Ti 在 Top-1 准确率上优于 AutoFormer-Ti 0.5%。
引用
@article{arxiv.2208.10861,
title = {FocusFormer: Focusing on What We Need via Architecture Sampler},
author = {Jing Liu and Jianfei Cai and Bohan Zhuang},
journal= {arXiv preprint arXiv:2208.10861},
year = {2022}
}
备注
Tech report