中文

ParFormer:一种具有并行混合器和稀疏通道注意力补丁嵌入的视觉Transformer

计算机视觉与模式识别 2024-10-03 v3 机器学习

摘要

卷积神经网络(CNN)和Transformer在计算机视觉任务中取得了显著成功。然而,它们的深层架构往往导致高计算冗余,使其不太适合资源受限的环境,如边缘设备。本文介绍了ParFormer,一种新颖的视觉Transformer,通过结合并行混合器(Parallel Mixer)和稀疏通道注意力补丁嵌入(SCAPE)来应对这一挑战。通过结合卷积和注意力机制,ParFormer改进了特征提取。这使得空间特征提取更高效,并减少了不必要的计算。SCAPE模块进一步降低了计算冗余,同时在下采样过程中保留了基本的特征信息。在ImageNet-1K数据集上的实验结果表明,ParFormer-T在GPU上实现了78.9%的Top-1准确率,并具有高吞吐量,优于其他小型模型,其吞吐量比MobileViT-S高2.56倍,比FasterNet-T2快0.24%,比EdgeNeXt-S高1.79倍。在边缘设备部署方面,ParFormer-T表现出色,吞吐量达到278.1 images/sec,比EdgeNeXt-S高1.38倍,比MobileViT-S高2.36倍,使其非常适合资源受限环境中的实时应用。更大的变体ParFormer-L达到了83.5%的Top-1准确率,在准确率和效率之间提供了平衡的权衡,超越了许多最先进的模型。在COCO目标检测中,ParFormer-M实现了40.7 AP的目标检测和37.6 AP的实例分割,以显著更高的效率超越了ResNet-50、PVT-S和PoolFormer-S24等模型。这些结果验证了ParFormer作为一种高效且可扩展的模型,适用于高性能和资源受限的场景,使其成为基于边缘的AI应用的理想解决方案。

关键词

引用

@article{arxiv.2403.15004,
  title  = {ParFormer: A Vision Transformer with Parallel Mixer and Sparse Channel Attention Patch Embedding},
  author = {Novendra Setyawan and Ghufron Wahyu Kurniawan and Chi-Chia Sun and Jun-Wei Hsieh and Jing-Ming Guo and Wen-Kai Kuo},
  journal= {arXiv preprint arXiv:2403.15004},
  year   = {2024}
}

备注

Under Review in IEEE Transactions on Cognitive and Developmental System