中文

GLMHA:一种用于高效图像恢复和光谱重建的引导式低秩多头自注意力机制

计算机视觉与模式识别 2024-10-02 v1

摘要

图像恢复和光谱重建是长期存在的计算机视觉任务。目前,CNN-Transformer混合模型为这些任务提供了最先进的性能。这些模型架构设计中的关键共同要素是通道自注意力(CSA)。我们首先证明CSA本质上是一种低秩操作。然后,我们提出了一种实例引导的低秩多头自注意力(GLMHA)来替代CSA,以在紧密保持原始模型性能的同时获得可观的计算收益。所提出的GLMHA的独特之处在于它能够为短输入序列和长输入序列都提供计算收益。具体来说,收益体现在浮点运算次数(FLOPs)和参数数量的减少上。这与现有的流行计算复杂度降低技术(例如Linformer、Performer和Reformer)形成对比,对于这些技术,FLOPs会压倒针对较短输入序列的高效设计技巧。此外,现有方法中参数减少仍未得到考虑。我们通过使用我们的GLMHA增强性能最佳的模型,对从RGB图像进行光谱重建、从快照压缩成像进行光谱重建、运动去模糊和图像去雨等任务进行了广泛评估。我们的结果显示,在需要减少370K个参数的情况下,FLOPs最多可减少7.7 Giga,从而紧密保持使用CSA的性能最佳模型的原始性能。

关键词

引用

@article{arxiv.2410.00380,
  title  = {GLMHA A Guided Low-rank Multi-Head Self-Attention for Efficient Image Restoration and Spectral Reconstruction},
  author = {Zaid Ilyas and Naveed Akhtar and David Suter and Syed Zulqarnain Gilani},
  journal= {arXiv preprint arXiv:2410.00380},
  year   = {2024}
}