FViT:一种带有 Gabor 滤波器的焦点 Vision Transformer
计算机视觉与模式识别
2025-01-22 v3
摘要
Vision Transformer 在各种计算机视觉任务中取得了令人鼓舞的进展。普遍观点认为,这归因于自注意力在建模特征 token 之间全局依赖关系方面的能力。然而,自注意力在密集预测任务中仍面临若干挑战,包括高计算复杂度和缺乏理想的归纳偏置。为缓解这些问题,我们重新审视了将 Vision Transformer 与 Gabor 滤波器结合的潜在优势,并提出了一种使用卷积的可学习 Gabor 滤波器 (LGF)。LGF 不依赖自注意力,用于模拟生物视觉系统中基本细胞对输入图像的响应。这促使 Vision Transformer 关注不同尺度和方向上目标的判别性特征表示。此外,基于 LGF 设计了一种仿生焦点视觉 (BFV) 模块。该模块灵感源自神经科学,并引入了双路前馈网络 (DPFFN) 以模拟生物视觉皮层的并行和级联信息处理方案。此外,通过堆叠 BFV 模块,开发了一类统一且高效的金字塔主干网络家族,称为焦点 Vision Transformer (FViTs)。实验结果表明,FViTs 在各种视觉任务中表现出卓越的性能。在计算效率和可扩展性方面,FViTs 相比其他同类模型显示出显著优势。
引用
@article{arxiv.2402.11303,
title = {FViT: A Focal Vision Transformer with Gabor Filter},
author = {Yulong Shi and Mingwei Sun and Yongshuai Wang and Zengqiang Chen},
journal= {arXiv preprint arXiv:2402.11303},
year = {2025}
}
备注
This work has been submitted to Elsevier for possible publication