在Transformer中共享关键语义实现高效图像恢复
计算机视觉与模式识别
2024-12-19 v2
摘要
图像恢复(IR)作为经典的底层视觉任务,通过有效建模全局信息的深度模型取得了显著进展。值得注意的是,视觉Transformer(ViT)的出现进一步推动了这些进展。在计算中,自注意力机制作为ViT的基石,倾向于涵盖所有全局线索,甚至包括来自语义无关对象或区域的线索。这种包容性引入了计算效率低下的问题,特别是在高输入分辨率下,因为需要处理不相关信息,从而阻碍了效率。此外,对于IR,通常注意到退化图像的小片段,特别是那些语义紧密对齐的片段,提供了特别相关的信息来帮助恢复过程,因为它们贡献了准确重建所必需的关键上下文线索。为了解决这些挑战,本文提出通过Transformer共享关键语义来提升IR性能(即SemanIR)。具体来说,SemanIR首先在每个Transformer阶段内通过为每个退化补丁建立必要的语义连接,构建一个稀疏但全面的关键语义字典。随后,该字典在同一阶段内的所有后续Transformer块之间共享。这种策略通过仅关注存储在关键语义字典中的语义相关组件,优化了每个块内的注意力计算。因此,注意力计算在每个窗口内实现了线性计算复杂度。在6个IR任务上的大量实验证实了所提出的SemanIR的最先进性能,在定量和定性上展示了进步。视觉结果、代码和训练好的模型可在https://github.com/Amazingren/SemanIR获取。
关键词
引用
@article{arxiv.2405.20008,
title = {Sharing Key Semantics in Transformer Makes Efficient Image Restoration},
author = {Bin Ren and Yawei Li and Jingyun Liang and Rakesh Ranjan and Mengyuan Liu and Rita Cucchiara and Luc Van Gool and Ming-Hsuan Yang and Nicu Sebe},
journal= {arXiv preprint arXiv:2405.20008},
year = {2024}
}
备注
Accepted by NeurIPS2024