中文

ConvShareViT:用于自由空间光加速器的卷积注意力机制增强视觉变换器

计算机视觉与模式识别 2025-04-17 v1 图像与视频处理

摘要

本文引入了 ConvShareViT,这是一种新型深度学习架构,将视觉变换器 (ViT) 适应于 4f 自由空间光系统。ConvShareViT 将多头自注意力 (MHSA) 和多层感知器 (MLP) 中的线性层替换为跨输入通道共享权重的深度卷积层。通过开发 ConvShareViT,系统地分析了卷积在 MHSA 中的行为及其在学习注意力机制中的有效性。实验结果表明,某些配置(特别是使用有效填充共享卷积的配置)能够成功学习注意力,实现与标准 ViT 相当的注意力得分。然而,其他配置(如使用相同填充卷积的配置)在注意力学习方面存在局限,表现为常规 CNN。ConvShareViT 架构专为 4f 光系统优化,利用了光系统的并行性和高分辨率能力。结果表明,ConvShareViT 在推理速度上理论上可比 GPU 系统快最高 3.04 倍。这种潜在加速使 ConvShareViT 成为未来光深学习应用的有吸引力的候选人,证明了我们的 ViT (ConvShareViT) 仅通过卷积操作即可实现,而无需通过必要的 ViT 优化来平衡性能和复杂度。

关键词

引用

@article{arxiv.2504.11517,
  title  = {ConvShareViT: Enhancing Vision Transformers with Convolutional Attention Mechanisms for Free-Space Optical Accelerators},
  author = {Riad Ibadulla and Thomas M. Chen and Constantino Carlos Reyes-Aldasoro},
  journal= {arXiv preprint arXiv:2504.11517},
  year   = {2025}
}