Inception Transformer
计算机视觉与模式识别
2022-05-27 v2 人工智能
机器学习
摘要
近期研究表明 Transformer 具有构建长程依赖的强大能力,却难以捕捉主要承载局部信息的高频信息。为解决此问题,我们提出一种新颖且通用的 Inception Transformer(简称 iFormer),可有效学习视觉数据中兼具高频与低频信息的全面特征。具体而言,我们设计了 Inception mixer,显式地将卷积与最大池化的优势嫁接到 Transformer 以捕获高频信息。与近期混合框架不同,Inception mixer 通过通道分割机制采用并行的卷积/最大池化路径与自注意力路径分别作为高频与低频混合器,带来更高效率,同时具备对宽频率范围内分散的判别信息建模的灵活性。考虑到底层更侧重捕获高频细节而顶层更侧重建模低频全局信息,我们进一步引入频率斜坡结构,即逐步减少送入高频混合器的维度并增加送入低频混合器的维度,从而有效权衡不同层间的高频与低频分量。我们在系列视觉任务上基准测试了 iFormer,并展示其在图像分类、COCO 检测与 ADE20K 分割上取得令人印象深刻的性能。例如,我们的 iFormer-S 在 ImageNet-1K 上达到 83.4% 的 top-1 准确率,远高于 DeiT-S 的 3.6%,且以仅 1/4 参数量和 1/3 FLOPs 甚至略优于更大的模型 Swin-B(83.3%)。代码与模型将发布于 https://github.com/sail-sg/iFormer。
引用
@article{arxiv.2205.12956,
title = {Inception Transformer},
author = {Chenyang Si and Weihao Yu and Pan Zhou and Yichen Zhou and Xinchao Wang and Shuicheng Yan},
journal= {arXiv preprint arXiv:2205.12956},
year = {2022}
}
备注
Code and models will be released at https://github.com/sail-sg/iFormer