面向 TinyML 图像分类的混合卷积和视觉 Transformer NAS 搜索空间
计算机视觉与模式识别
2026-01-01 v2 机器学习
摘要
卷积神经网络 (CNN) 和视觉 Transformer (ViT) 的混合模型已超过纯 CNN 或 ViT 架构。然而,这些架构需要大量参数且计算成本高,不适用于 TinyML 部署。本文提出一种新的混合 CNN-ViT 搜索空间,用于神经网络架构搜索 (NAS) 以寻找图像分类的高效混合架构。该搜索空间涵盖混合 CNN 和 ViT 块,以学习局部和全局信息,同时引入可搜索的池化块以实现高效特征图缩减。在 CIFAR10 数据集上的实验结果表明,我们提出的搜索空间能够产生在紧张模型大小约束下,准确率和推理速度均优于基于 ResNet 的 TinyML 模型的混合 CNN-ViT 架构。
引用
@article{arxiv.2511.02992,
title = {Hybrid Convolution and Vision Transformer NAS Search Space for TinyML Image Classification},
author = {Mikhael Djajapermana and Moritz Reiber and Daniel Mueller-Gritschneder and Ulf Schlichtmann},
journal= {arXiv preprint arXiv:2511.02992},
year = {2026}
}
备注
Presented at ITEM workshop co-located with ECML PKDD 2024, Vilnius LT