TcGAN:基于独立视觉Transformer的语义感知与结构保持GAN用于快速任意单次图像生成
计算机视觉与模式识别
2023-02-17 v1
摘要
从给定图像内部块学习的一次性图像生成(OSG)生成对抗网络已引起广泛关注。近期研究主要聚焦于用纯卷积神经网络(CNNs)从概率分布输入中提取图像特征。然而,感受野有限的CNN很难提取并维持全局结构信息。因此,本文提出一种新颖的结构保持方法TcGAN,采用独立视觉Transformer以克服现有一次性图像生成方法的不足。具体而言,TcGAN在训练期间保持图像全局结构以兼容局部细节,同时利用transformer强大的长程依赖建模能力维持语义感知信息的完整性。我们还提出一种在计算过程中具有尺度不变性的新缩放公式,有效提升了OSG模型在图像超分辨率任务上的生成图像质量。我们给出了TcGAN转换器框架的设计、全面的实验及消融研究,证明了TcGAN以最快运行时间实现任意图像生成的能力。最后,TcGAN在应用于其他图像处理任务(如超分辨率与图像协调)时取得最优性能,结果进一步证明其优越性。
引用
@article{arxiv.2302.08047,
title = {TcGAN: Semantic-Aware and Structure-Preserved GANs with Individual Vision Transformer for Fast Arbitrary One-Shot Image Generation},
author = {Yunliang Jiang and Lili Yan and Xiongtao Zhang and Yong Liu and Danfeng Sun},
journal= {arXiv preprint arXiv:2302.08047},
year = {2023}
}