中文

DeepMAD:深度卷积神经网络的数学架构设计

计算机视觉与模式识别 2023-06-01 v3 信息论 机器学习 math.IT

摘要

Vision Transformer(ViT)的快速发展刷新了各类视觉任务的最优性能,使传统的基于CNN的模型黯然失色。这引发了CNN领域近期若干反击研究,表明经细致调优的纯CNN模型可达到与ViT模型相当的性能。尽管令人鼓舞,设计此类高性能CNN模型颇具挑战,需要不平凡的网路设计先验知识。为此,提出一种称为深度CNN数学架构设计(DeepMAD)的新框架,以原则性方式设计高性能CNN模型。在DeepMAD中,CNN网络被建模为信息处理系统,其表达力与有效性可由结构参数解析刻画;进而提出约束数学规划(MP)问题以优化这些结构参数。该MP问题可借助现成MP求解器在CPU上以小内存占用轻松求解。此外,DeepMAD是纯数学框架:网络设计过程无需GPU或训练数据。DeepMAD的优越性在多个大规模计算机视觉基准数据集上得到验证。尤其在ImageNet-1k上,仅使用常规卷积层,DeepMAD在Tiny级别比ConvNeXt和Swin的top-1准确率分别高0.7%和1.5%,在Small级别分别高0.8%和0.9%。

关键词

引用

@article{arxiv.2303.02165,
  title  = {DeepMAD: Mathematical Architecture Design for Deep Convolutional Neural Network},
  author = {Xuan Shen and Yaohua Wang and Ming Lin and Yilun Huang and Hao Tang and Xiuyu Sun and Yanzhi Wang},
  journal= {arXiv preprint arXiv:2303.02165},
  year   = {2023}
}

备注

Accepted by CVPR 2023