MicroViTv2:超越 FLOPS 的边缘节能型 Vision Transformer
计算机视觉与模式识别
2026-05-12 v1
摘要
Vision Transformer(ViT)在各种视觉任务中取得了显著的准确率,但在边缘部署上仍然计算成本高昂。本文提出了 MicroViTv2,一种针对真实设备效率优化的轻量级 Vision Transformer。在原始 MicroViT 的基础上,所提出的模型基于重参数化设计,具体为用于更快推理的重参数化块嵌入和重参数化深度卷积混合器,并引入了单深度卷积转置注意力以最小的冗余捕获长距离依赖关系。尽管 FLOPs 略高,MicroViTv2 与其前身相比准确率提升了 0.5%,并超越了 MobileViTv2、EdgeNeXt 和 EfficientViT,同时在 Jetson AGX Orin 上保持了快速推理和高能效。在 ImageNet-1K 和 COCO 上的实验表明,硬件感知设计和结构重参数化是实现高准确率和低能耗的关键,验证了超越 FLOPs 评估效率的必要性。代码可在 https://github.com/novendrastywn/MicroViT 获取。
引用
@article{arxiv.2605.10148,
title = {MicroViTv2: Beyond the FLOPS for Edge Energy-Friendly Vision Transformers},
author = {Novendra Setyawan and Chi-Chia Sun and Mao-Hsiu Hsu and Wen-Kai Kuo and Jun-Wei Hsieh},
journal= {arXiv preprint arXiv:2605.10148},
year = {2026}
}