迈向视觉 Transformer 展开定点算法:以图像复原为例
计算机视觉与模式识别
2023-01-31 v1
摘要
深度神经网络(DNN)的巨大成功启发了基于 DNN 的定点(DNN-FP)方法在计算机视觉任务中的算法发展。通过时间反向传播或计算不精确的 Jacobian 逆训练的 DNN-FP 方法存在表征能力较弱的问题。受 Transformer 表征能力的启发,我们提出一种将 FP 展开并通过 Transformer 块近似每个展开过程的框架,称为 FPformer。为降低内存与计算的高消耗,我们提出 FPRformer,在连续块之间共享参数。我们进一步设计了一个将 Anderson 加速适配于 FPRformer 以增大展开迭代次数并提升性能的模块,称为 FPAformer。为充分挖掘 Transformer 的能力,我们将所提模型应用于图像复原,采用自监督预训练与有监督微调。预训练阶段使用了来自 4 类图像复原问题的 161 个任务。此后,预训练的 FPformer、FPRformer 和 FPAformer 被进一步微调用于对比场景。采用自监督预训练与有监督微调,所提 FPformer、FPRformer 和 FPAformer 取得了与最先进图像复原方法相当的性能及更优的训练效率。FPAformer 仅使用 SwinIR 模型 29.82% 的参数,并在微调后提供更优性能。训练这些对比模型仅花费训练 SwinIR 模型所用时间的 26.9%。这为在底层视觉任务中引入 Transformer 提供了一条有前景的途径。
引用
@article{arxiv.2301.12332,
title = {Towards Vision Transformer Unrolling Fixed-Point Algorithm: a Case Study on Image Restoration},
author = {Peng Qiao and Sidun Liu and Tao Sun and Ke Yang and Yong Dou},
journal= {arXiv preprint arXiv:2301.12332},
year = {2023}
}