iFormer:面向移动应用的 ConvNet 与 Transformer 集成模型
计算机视觉与模式识别
2025-02-18 v2 人工智能
机器学习
摘要
我们提出一种新的移动混合视觉网络家族,称为 iFormer,旨在优化移动应用中的延迟和准确率。iFormer 有效地集成了卷积的快速局部表征能力与自注意力的高效全局建模能力。局部交互来自将标准卷积网络(即 ConvNeXt)转化以设计更轻量级的移动网络。我们引入的移动调制注意力消除了 MHA 中的高内存密集操作,并采用高效的调制机制提升动态全局表征能力。我们进行了全面的实验,表明 iFormer 在各种任务上均优于现有轻量级网络。值得注意的是,在 iPhone 13 上延迟仅为 1.10 ms 时,iFormer 在 ImageNet-1k 上实现了惊人的 80.4% 的 Top-1 准确率,超越了在类似延迟约束下最近提出的 MobileNetV4。此外,我们的方法在下游任务中显示出显著改进,包括 COCO 目标检测、实例分割和 ADE20k 语义分割,同时仍在移动设备上保持低延迟,以高分辨率输入处理这些场景。
关键词
引用
@article{arxiv.2501.15369,
title = {iFormer: Integrating ConvNet and Transformer for Mobile Application},
author = {Chuanyang Zheng},
journal= {arXiv preprint arXiv:2501.15369},
year = {2025}
}
备注
Accepted to ICLR 2025. Code: https://github.com/ChuanyangZheng/iFormer