用于图像分类的全局滤波器网络
计算机视觉与模式识别
2021-10-27 v2 人工智能
机器学习
摘要
近期自注意力与纯多层感知机(MLP)视觉模型的进展显示出以更少归纳偏置取得可观性能的潜力。这些模型通常基于从原始数据中学习空间位置间的交互。自注意力与MLP的复杂度随图像尺寸增大而呈二次增长,这使得在高分辨率特征需求下难以扩展这些模型。本文提出全局滤波器网络(GFNet),一种概念简单且计算高效的架构,以对数线性复杂度在频域中学习长程空间依赖。我们的架构将视觉Transformer中的自注意力层替换为三个关键操作:二维离散傅里叶变换、频域特征与可学习全局滤波器间的逐元素乘法,以及二维逆傅里叶变换。我们在ImageNet及下游任务上展示了模型优越的精度/复杂度权衡。结果表明,GFNet在效率、泛化能力与鲁棒性上可作为Transformer风格模型与CNN极具竞争力的替代方案。代码见 https://github.com/raoyongming/GFNet
引用
@article{arxiv.2107.00645,
title = {Global Filter Networks for Image Classification},
author = {Yongming Rao and Wenliang Zhao and Zheng Zhu and Jiwen Lu and Jie Zhou},
journal= {arXiv preprint arXiv:2107.00645},
year = {2021}
}
备注
Accepted to NeurIPS 2021. Project page: https://gfnet.ivg-research.xyz/