通过全局架构因子的高斯过程导航MobileViT的效率
计算机视觉与模式识别
2024-06-10 v1 人工智能
摘要
众多技术被精心设计以实现卷积神经网络(CNN)的最优架构,但对视觉Transformer(ViT)的类似关注却有所欠缺。尽管ViT在各种视觉任务中取得了显著成功,但其重量级特性带来了计算成本的挑战。在本文中,我们利用高斯过程系统地探索了MobileViT的性能与全局架构因子(如分辨率、宽度和深度,包括倒残差块深度和ViT块深度)以及联合因子(包括分辨率-深度和分辨率-宽度)之间的非线性和不确定关系。我们提出了设计原则,以扭转全局架构因子的魔方4D立方体,从而在更高模型精度下最小化模型大小和计算成本。我们引入了一个通过迭代推导更小MobileViT V2来缩小架构的公式,同时遵循指定的乘加操作(MACs)约束。实验结果表明,我们的公式在多样化数据集上显著优于CNN和移动ViT。
引用
@article{arxiv.2406.04820,
title = {Navigating Efficiency in MobileViT through Gaussian Process on Global Architecture Factors},
author = {Ke Meng and Kai Chen},
journal= {arXiv preprint arXiv:2406.04820},
year = {2024}
}