MobileViTv3:融合局部、全局与输入特征的移动端友好视觉 Transformer
摘要
MobileViT(MobileViTv1)结合卷积神经网络(CNNs)与视觉 Transformer(ViTs)以创建用于移动视觉任务的轻量模型。尽管主要的 MobileViTv1 模块有助于取得有竞争力的 SOTA 结果,MobileViTv1 模块内部的融合块带来了缩放挑战且学习任务复杂。我们提出对融合块进行简单而有效的改动以创建 MobileViTv3 模块,其解决了缩放问题并简化了学习任务。我们提出的 MobileViTv3 模块用于创建 MobileViTv3-XXS、XS 和 S 模型,在 ImageNet-1k、ADE20K、COCO 和 PascalVOC2012 数据集上优于 MobileViTv1。在 ImageNet-1K 上,MobileViTv3-XXS 和 MobileViTv3-XS 分别超越 MobileViTv1-XXS 和 MobileViTv1-XS 达 2% 和 1.9%。近期发布的 MobileViTv2 架构移除融合块并使用线性复杂度 Transformer 以取得优于 MobileViTv1 的表现。我们将提出的融合块添加至 MobileViTv2 以创建 MobileViTv3-0.5、0.75 和 1.0 模型。这些新模型在 ImageNet-1k、ADE20K、COCO 和 PascalVOC2012 数据集上相比 MobileViTv2 给出更优的精度数值。MobileViTv3-0.5 和 MobileViTv3-0.75 在 ImageNet-1K 数据集上分别超越 MobileViTv2-0.5 和 MobileViTv2-0.75 达 2.1% 和 1.0%。对于分割任务,MobileViTv3-1.0 在 ADE20K 数据集和 PascalVOC2012 数据集上相比 MobileViTv2-1.0 分别取得 2.07% 和 1.1% 更优的 mIOU。我们的代码与训练模型可见于:https://github.com/micronDLA/MobileViTv3
引用
@article{arxiv.2209.15159,
title = {MobileViTv3: Mobile-Friendly Vision Transformer with Simple and Effective Fusion of Local, Global and Input Features},
author = {Shakti N. Wadekar and Abhishek Chaurasia},
journal= {arXiv preprint arXiv:2209.15159},
year = {2022}
}
备注
20 pages, 7 figures