MicroViT:面向边缘设备的低复杂度自注意力Vision Transformer
计算机视觉与模式识别
2025-07-03 v1
摘要
Vision Transformer(ViT)在各种计算机视觉任务中展现了卓越的性能,但其高计算需求使其难以在资源有限的边缘设备上实现。本文提出了MicroViT,这是一种为边缘设备优化的轻量级Vision Transformer架构,通过显著降低计算复杂度同时保持高准确率。MicroViT的核心是Efficient Single Head Attention(ESHA)机制,它利用分组卷积来减少特征冗余性,并仅处理部分通道,从而降低自注意力机制的负担。MicroViT采用多阶段MetaFormer架构设计,将多个MicroViT编码器堆叠以提升效率和性能。在ImageNet-1K和COCO数据集上的全面实验表明,MicroViT在保持竞争准确率的同时,显著提升了3.6倍的推理速度,并以40%更高的能源效率优于MobileViT系列,适用于移动和边缘设备等资源受限环境的部署。
引用
@article{arxiv.2502.05800,
title = {MicroViT: A Vision Transformer with Low Complexity Self Attention for Edge Device},
author = {Novendra Setyawan and Chi-Chia Sun and Mao-Hsiu Hsu and Wen-Kai Kuo and Jun-Wei Hsieh},
journal= {arXiv preprint arXiv:2502.05800},
year = {2025}
}