SeaFormer++:面向移动端视觉识别的压缩增强轴向 Transformer
计算机视觉与模式识别
2025-02-10 v6
摘要
自 Vision Transformers 引入以来,许多此前由 CNN 绝对主导的计算机视觉任务(如语义分割)的格局近期已被显著革新。然而,计算成本与内存需求使这些方法不适用于移动设备。本文中,我们引入一种用于移动端视觉识别的新方法——压缩增强轴向 Transformer(SeaFormer)。具体而言,我们设计了一个以压缩轴向与细节增强公式为特征的通用注意力块。它可进一步用于创建一系列具有优越性价比的主干架构。配合轻量分割头,我们在基于 ARM 的移动设备上于 ADE20K、Cityscapes、Pascal Context 和 COCO-Stuff 数据集上实现了分割精度与延迟之间的最佳权衡。关键在于,我们不借助任何花哨技巧便以更优性能与更低延迟击败了移动端友好型对手与基于 Transformer 的同类方法。此外,我们融入基于特征上采样的多分辨率蒸馏技术,进一步降低所提框架的推理延迟。除语义分割外,我们还将所提 SeaFormer 架构应用于图像分类与目标检测问题,展示了其作为通用移动端友好主干的潜力。我们的代码与模型已公开于 https://github.com/fudan-zvg/SeaFormer。
引用
@article{arxiv.2301.13156,
title = {SeaFormer++: Squeeze-enhanced Axial Transformer for Mobile Visual Recognition},
author = {Qiang Wan and Zilong Huang and Jiachen Lu and Gang Yu and Li Zhang},
journal= {arXiv preprint arXiv:2301.13156},
year = {2025}
}
备注
V4 is the ICLR 2023 conference version, and V6 is the IJCV 2025 version