中文

面向 TinyML 图像分类的混合卷积和视觉 Transformer NAS 搜索空间

计算机视觉与模式识别 2026-01-01 v2 机器学习

摘要

卷积神经网络 (CNN) 和视觉 Transformer (ViT) 的混合模型已超过纯 CNN 或 ViT 架构。然而,这些架构需要大量参数且计算成本高,不适用于 TinyML 部署。本文提出一种新的混合 CNN-ViT 搜索空间,用于神经网络架构搜索 (NAS) 以寻找图像分类的高效混合架构。该搜索空间涵盖混合 CNN 和 ViT 块,以学习局部和全局信息,同时引入可搜索的池化块以实现高效特征图缩减。在 CIFAR10 数据集上的实验结果表明,我们提出的搜索空间能够产生在紧张模型大小约束下,准确率和推理速度均优于基于 ResNet 的 TinyML 模型的混合 CNN-ViT 架构。

关键词

引用

@article{arxiv.2511.02992,
  title  = {Hybrid Convolution and Vision Transformer NAS Search Space for TinyML Image Classification},
  author = {Mikhael Djajapermana and Moritz Reiber and Daniel Mueller-Gritschneder and Ulf Schlichtmann},
  journal= {arXiv preprint arXiv:2511.02992},
  year   = {2026}
}

备注

Presented at ITEM workshop co-located with ECML PKDD 2024, Vilnius LT