T-former:一种高效的图像修复 Transformer
计算机视觉与模式识别
2023-05-22 v2
摘要
受益于强大的卷积神经网络(CNNs),基于学习的图像修复方法多年来取得了显著突破。然而,CNN 的一些特性(如局部先验、空间共享参数)在面对形式多样且复杂的破损图像时限制了性能。最近,一类称为 transformer 的基于注意力的网络架构在自然语言处理领域和高层视觉任务上展现了显著性能。与 CNN 相比,注意力算子更擅长长程建模且具有动态权重,但其计算复杂度在空间分辨率上呈二次方增长,因此不太适合涉及较高分辨率图像的应用,如图像修复。在本文中,我们根据泰勒展开设计了一种与分辨率线性相关的新型注意力。基于此注意力,设计了一个称为 -former 的网络用于图像修复。在多个基准数据集上的实验表明,我们提出的方法在保持相对较少的参数数量和计算复杂度的同时达到了最先进的精度。代码可在 \href{https://github.com/dengyecode/T-former_image_inpainting}{github.com/dengyecode/T-former\_image\_inpainting} 获取。
引用
@article{arxiv.2305.07239,
title = {T-former: An Efficient Transformer for Image Inpainting},
author = {Ye Deng and Siqi Hui and Sanping Zhou and Deyu Meng and Jinjun Wang},
journal= {arXiv preprint arXiv:2305.07239},
year = {2023}
}