Retina Vision Transformer (RetinaViT):将缩放斑块引入 Vision Transformer
计算机视觉与模式识别
2025-09-26 v2
摘要
人类先看到低空间频率成分,后看到高空间频率成分。受此神经科学启发,我们研究了将来自不同空间频率的斑块引入 Vision Transformer (ViTs) 的效果。由于灵感来源于人类视觉系统,我们将此模型命名为 Retina Vision Transformer (RetinaViT)。我们在基准数据上的实验表明,RetinaViT 在早期层中表现出关注低空间频率成分的强烈倾向,并随着网络深度的增加将注意力转移到高空间频率成分。这种倾向在没有任何额外归纳偏置的情况下自行出现,并与人类视觉系统的视觉处理顺序相一致。我们假设 RetinaViT 在后续层关注精细细节之前,会在早期层捕获结构特征或场景要旨,这与主流骨干视觉模型(如 CNN)的处理顺序相反。我们还观察到,与原始 ViT 相比,RetinaViT 在模型大小显著减小的情况下更具鲁棒性,我们推测这得益于其早期捕获场景要旨的能力。
引用
@article{arxiv.2403.13677,
title = {Retina Vision Transformer (RetinaViT): Introducing Scaled Patches into Vision Transformers},
author = {Yuyang Shu and Michael E. Bain},
journal= {arXiv preprint arXiv:2403.13677},
year = {2025}
}