中文

UniNet:融合卷积、Transformer与MLP的统一架构搜索

计算机视觉与模式识别 2022-09-13 v2 人工智能

摘要

近年来,Transformer和多层感知机(MLP)架构在各种视觉任务上取得了令人印象深刻的成果。然而,如何有效地组合这些算子以形成高性能的混合视觉架构仍然是一个挑战。在这项工作中,我们通过提出一种新颖的统一架构搜索方法来研究卷积、Transformer和MLP的可学习组合。我们的方法包含两个关键设计以实现高性能网络的搜索。首先,我们将差异很大的可搜索算子以统一形式建模,从而使这些算子能够用同一组配置参数来表征。通过这种方式,整体搜索空间大小显著减小,总搜索代价变得可承受。其次,我们提出上下文感知下采样模块(DSMs)来缓解不同类型算子之间的鸿沟。我们提出的DSMs能够更好地适配来自不同类型算子的特征,这对于识别高性能混合架构十分重要。最后,我们将可配置算子和DSMs整合到一个统一搜索空间中,并使用基于强化学习的搜索算法进行搜索,以充分探索算子的最优组合。为此,我们搜索了一个基线网络并将其扩展得到一系列模型,称为UniNets,其准确性和效率均大幅优于以往的ConvNets和Transformers。特别地,我们的UniNet-B5在ImageNet上达到84.9%的top-1准确率,分别以少44%和55%的FLOPs优于EfficientNet-B7和BoTNet-T7。通过在ImageNet-21K上预训练,我们的UniNet-B6达到87.4%,以少51%的FLOPs和少41%的参数优于Swin-L。代码见 https://github.com/Sense-X/UniNet。

关键词

引用

@article{arxiv.2207.05420,
  title  = {UniNet: Unified Architecture Search with Convolution, Transformer, and MLP},
  author = {Jihao Liu and Xin Huang and Guanglu Song and Hongsheng Li and Yu Liu},
  journal= {arXiv preprint arXiv:2207.05420},
  year   = {2022}
}

备注

ECCV 2022, code at https://github.com/Sense-X/UniNet. arXiv admin note: substantial text overlap with arXiv:2110.04035