AgileIR:用于敏捷图像修复的内存高效组分离窗口注意力
人机交互
2024-09-11 v1 计算与语言
摘要
图像转换器在图像修复任务中表现出惊人的成功。然而,大多数基于转换器的模型严重受限于巨大的内存占用。我们的目标是在降低内存消耗的同时加快训练过程中的模型速度。因此,我们引入 AgileIR,结合组分离注意力机制和窗口注意力机制,对模型架构进行稀疏化简。我们提出组分离窗口注意力(GSWA),将位移窗口多头自注意力(SW-MSA)和窗口多头自注意力(W-MSA)在注意力头上分解为组,从而在反向传播期间缩小内存用量。此外,我们保持位移窗口遮罩及其位移可学习偏置,以诱导模型在通道内跨窗口相互作用。我们还重新分配投影参数以加速注意力矩阵计算,我们发现对性能影响微小。实验结果表明,与我们的基线 SwinIR 和其他高效量化模型相比,AgileIR 在 Set5 评估数据集上保持 32.20 dB 的性能,超过其他采用定制高效方法的模型,同时在大批量处理下节省超过 50% 的内存。
引用
@article{arxiv.2409.06205,
title = {SHAPE-IT: Exploring Text-to-Shape-Display for Generative Shape-Changing Behaviors with LLMs},
author = {Wanli Qian and Chenfeng Gao and Anup Sathya and Ryo Suzuki and Ken Nakagaki},
journal= {arXiv preprint arXiv:2409.06205},
year = {2024}
}
备注
Accepted for ACM UIST 2024