中文

焦点调制网络

计算机视觉与模式识别 2022-11-08 v3 人工智能 机器学习

摘要

我们提出焦点调制网络(简称 FocalNets),其中自注意力(SA)被完全替换为一种焦点调制机制,用于建模视觉中的令牌交互。焦点调制包含三个组件:(i)使用一堆深度可分离卷积层实现的分层上下文编码,以从短到长范围编码视觉上下文;(ii)门控聚合,基于每个查询令牌的内容选择性地收集上下文;(iii)逐元素调制或仿射变换,将聚合的上下文注入查询。大量实验表明,在图像分类、目标检测与分割任务上,FocalNets 以相似的计算成本优于最先进的 SA 对应模型(如 Swin 与 Focal Transformers)。具体而言,tiny 与 base 尺寸的 FocalNets 在 ImageNet-1K 上分别达到 82.3% 与 83.9% 的 top-1 准确率。在 ImageNet-22K 上以 224 分辨率预训练后,其在 224 与 384 分辨率微调时分别达到 86.5% 与 87.3% 的 top-1 准确率。迁移到下游任务时,FocalNets 展现出明显优势。对于使用 Mask R-CNN 的目标检测,以 1× 训练的 FocalNet base 比 Swin 对应模型高出 2.1 个点,且已超过以 3× 调度训练的 Swin(49.0 对比 48.5)。对于使用 UPerNet 的语义分割,单尺度的 FocalNet base 比 Swin 高出 2.4,并在多尺度下击败 Swin(50.5 对比 49.7)。使用 large FocalNet 与 Mask2former,我们在 ADE20K 语义分割上取得 58.5 mIoU,在 COCO Panoptic Segmentation 上取得 57.9 PQ。使用 huge FocalNet 与 DINO,我们在 COCO minival 与 test-dev 上分别取得 64.3 与 64.4 mAP,在远大于基于注意力的模型(如 Swinv2-G 与 BEIT-3)的基础上确立了新的 SOTA。代码与检查点见 https://github.com/microsoft/FocalNet。

关键词

引用

@article{arxiv.2203.11926,
  title  = {Focal Modulation Networks},
  author = {Jianwei Yang and Chunyuan Li and Xiyang Dai and Lu Yuan and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2203.11926},
  year   = {2022}
}

备注

NeurIPS 2022 camera-ready extension