中文

作为图像处理器的高效掩码自编码器

计算机视觉与模式识别 2023-03-31 v1

摘要

Transformer 已在包括高层视觉和低层视觉在内的各种视觉任务中展现出显著的有效性。最近,用于特征预训练的掩码自编码器(MAE)进一步释放了 Transformer 的潜力,在各种高层视觉任务上取得了最先进的性能。然而,MAE 预训练在低层视觉任务上的重要性尚未得到充分探索。在本文中,我们表明掩码自编码器也是可扩展的自监督学习器,适用于图像处理任务。我们首先提出了一个同时考虑通道注意力和基于移位窗口的自注意力的高效 Transformer 模型,称为 CSformer。然后我们开发了一个用于图像处理(MAEIP)任务的有效 MAE 架构。大量实验结果表明,在 MAEIP 预训练的帮助下,我们提出的 CSformer 在各种图像处理任务上取得了最先进的性能,包括高斯去噪、真实图像去噪、单图像运动去模糊、散焦去模糊和图像去雨。

关键词

引用

@article{arxiv.2303.17316,
  title  = {Masked Autoencoders as Image Processors},
  author = {Huiyu Duan and Wei Shen and Xiongkuo Min and Danyang Tu and Long Teng and Jia Wang and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2303.17316},
  year   = {2023}
}