中文

EMOv2:推进 500 万参数视觉模型的新前沿

计算机视觉与模式识别 2024-12-10 v1

摘要

本工作聚焦于开发用于密集预测的参数高效轻量化模型,需在参数、FLOPs与性能之间进行权衡。我们的目标是为各种下游任务建立 500 万参数量级轻量模型的新基准。倒置残差块(IRB)是轻量化 CNN 的基础设施,但尚无针对注意力类模型的对应方案被认可。我们从统一视角重新思考高效 IRB 及 Transformer 中实用组件的轻量化基础设施,将基于 CNN 的 IRB 扩展至注意力类模型,抽象出一种用于轻量模型设计的单残差元移动块(Meta Mobile Block, MMBlock)。遵循简洁而有效的设计准则,我们推导出一种现代化改进倒置残差移动块(Improved Inverted Residual Mobile Block, i2RMB),并构建出无需复杂结构的分层高效模型(EMOv2)。考虑到在 4G/5G 带宽下下载模型时的感知延迟以及确保模型性能,我们探索了 500 万参数量级轻量模型的性能上限。在各种视觉识别、密集预测和图像生成任务上的大量实验表明,EMOv2 在状态-of-the-art 方法之上,例如 EMOv2-1M/2M/5M 分别实现了 72.3、75.8 和 79.4 的 Top-1 准确率,显著超越等级 CNN/注意力类模型。同时,搭载 RetinaNet 的 EMOv2-5M 在目标检测任务中实现 41.5 mAP,超越前代 EMO-5M 高出 +2.6。当采用更稳健的训练配方时,EMOv2-5M 最终实现 82.9 的 Top-1 准确率,将 500 万参数量级模型的性能提升至新水平。代码已公开于 https://github.com/zhangzjn/EMOv2。

关键词

引用

@article{arxiv.2412.06674,
  title  = {EMOv2: Pushing 5M Vision Model Frontier},
  author = {Jiangning Zhang and Teng Hu and Haoyang He and Zhucun Xue and Yabiao Wang and Chengjie Wang and Yong Liu and Xiangtai Li and Dacheng Tao},
  journal= {arXiv preprint arXiv:2412.06674},
  year   = {2024}
}