ExMobileViT:面向移动端视觉Transformer的轻量级分类器扩展
计算机视觉与模式识别
2023-09-06 v1 人工智能
摘要
本文提出一种高效结构,以较小的计算开销增强移动端友好视觉 transformer 的性能。视觉 transformer (ViT) 相较于传统卷积神经网络(CNNs) 在图像分类中取得了更优结果,极具吸引力。由于其需要较高的计算资源,已开发出基于 MobileNet 的 ViT 模型如 MobileViT-S。然而,其性能未能达到原始 ViT 模型。所提结构通过存储早期注意力阶段的信息并在最终分类器中复用,缓解了上述不足。本文的动机源于如下观点:早期注意力阶段的数据本身对最终分类可能具有重要意义。为复用早期注意力阶段信息,将早期注意力阶段不同尺度特征的平均池化结果用于扩展最终分类器全连接层的通道。期望平均特征引入的归纳偏置能提升最终性能。由于所提结构仅需注意力阶段特征的平均池化及最终分类器的通道扩展,其计算与存储开销极小,保持了低成本基于 MobileNet 的 ViT (MobileViT) 的优势。在 ImageNet 数据集上相较于原始 MobileViT,所提 ExMobileViT 准确率提升显著,仅增加约 5% 的参数量。
引用
@article{arxiv.2309.01310,
title = {ExMobileViT: Lightweight Classifier Extension for Mobile Vision Transformer},
author = {Gyeongdong Yang and Yungwook Kwon and Hyunjin Kim},
journal= {arXiv preprint arXiv:2309.01310},
year = {2023}
}
备注
Under Review