SwinStyleformer是图像反演的一个优选方案
计算机视觉与模式识别
2024-06-21 v1
摘要
本文提出了第一个纯Transformer结构的反演网络,称为SwinStyleformer,它通过处理长程依赖和学习对象的全局结构,可以弥补CNN反演框架的不足。实验发现,基于Transformer主干的反演网络无法成功反演图像。上述现象源于CNN和Transformer之间的差异,例如与卷积相比,自注意力权重偏向于图像结构而忽略图像细节,Transformer缺乏多尺度特性,以及Transformer提取的潜在编码与StyleGAN风格向量之间的分布差异。为了解决这些差异,我们采用具有更小窗口大小的Swin Transformer作为SwinStyleformer的主干,以增强反演图像的局部细节。同时,我们设计了一个基于可学习查询的Transformer块。与自注意力Transformer块相比,基于可学习查询的Transformer块提供了更大的适应性和灵活性,使模型能够根据特定任务更新注意力权重。因此,反演焦点不限于图像结构。为了进一步引入多尺度特性,我们在特征图提取中设计了多尺度连接。多尺度连接使模型能够全面理解图像,避免因全局建模而丢失细节。此外,我们提出了一个反演判别器和分布对齐损失来最小化分布差异。基于上述设计,我们的SwinStyleformer成功解决了Transformer的反演失败问题,并在图像反演及多项相关视觉任务中展示了SOTA性能。
引用
@article{arxiv.2406.13153,
title = {SwinStyleformer is a favorable choice for image inversion},
author = {Jiawei Mao and Guangyi Zhao and Xuesong Yin and Yuanqi Chang},
journal= {arXiv preprint arXiv:2406.13153},
year = {2024}
}