EViT:具有双中央凹自注意力的鹰视觉Transformer
计算机视觉与模式识别
2025-02-11 v4
摘要
得益于深度学习技术的进步,视觉Transformer(ViTs)已在多种计算机视觉任务中展现出令人印象深刻的性能。然而,ViTs仍面临一些挑战,如高计算复杂度与缺乏理想的归纳偏置。为缓解这些问题,我们探索了将鹰视觉与ViTs结合的潜在优势。受鹰眼独特生理与视觉特征启发,我们总结了双中央凹视觉交互(BFVI)结构。基于此结构设计方法,提出新颖的双中央凹自注意力(BFSA)机制与双中央凹前馈网络(BFFN),可用于模拟生物视觉皮层的层次化与并行信息处理方案,使网络以由粗到细的方式学习目标特征表示。此外,基于BFSA机制与BFFN设计了仿生鹰视觉(BEV)模块作为基本构建单元。通过堆叠BEV模块,开发了统一且高效的金字塔骨干网络家族——鹰视觉Transformer(EViTs)。实验结果表明,EViTs在图像分类、目标检测与语义分割等多种计算机视觉任务中表现出极具竞争力的性能。与其他方法相比,EViTs具有显著优势,尤其在性能与计算效率方面。代码见https://github.com/nkusyl/EViT。
引用
@article{arxiv.2310.06629,
title = {EViT: An Eagle Vision Transformer with Bi-Fovea Self-Attention},
author = {Yulong Shi and Mingwei Sun and Yongshuai Wang and Jiahao Ma and Zengqiang Chen},
journal= {arXiv preprint arXiv:2310.06629},
year = {2025}
}
备注
This work has been submitted to the IEEE for possible publication