中文

用于视觉任务的基于 FFT 的动态令牌混合器

计算机视觉与模式识别 2023-12-19 v2 人工智能 机器学习

摘要

配备多头自注意力(MHSA)的模型在计算机视觉中取得了显著性能。其计算复杂度与输入特征图中像素数的二次方成正比,导致处理缓慢,尤其在处理高分辨率图像时。作为 MHSA 的替代方案,人们提出了新型令牌混合器(token-mixer)以规避此问题:基于 FFT 的令牌混合器涉及与 MHSA 类似的全局操作,但计算复杂度更低。然而,尽管其特性引人注目,基于 FFT 的令牌混合器在与其快速发展的 MetaFormer 架构的兼容性方面尚未被仔细考察。为此,我们提出一种称为动态滤波器(Dynamic Filter)的新型令牌混合器以及新型图像识别模型 DFFormer 和 CDFFormer,以弥补上述不足。图像分类及下游任务的结果、分析与可视化表明我们的模型是有帮助的。值得注意的是,它们在应对高分辨率图像识别时的吞吐量与内存效率十分突出。我们的结果表明动态滤波器是应当被认真考虑的令牌混合器选项之一。代码见 https://github.com/okojoalg/dfformer

关键词

引用

@article{arxiv.2303.03932,
  title  = {FFT-based Dynamic Token Mixer for Vision},
  author = {Yuki Tatsunami and Masato Taki},
  journal= {arXiv preprint arXiv:2303.03932},
  year   = {2023}
}

备注

The 38th Annual AAAI Conference on Artificial Intelligence (AAAI'24)