中文

TcGAN:基于独立视觉Transformer的语义感知与结构保持GAN用于快速任意单次图像生成

计算机视觉与模式识别 2023-02-17 v1

摘要

从给定图像内部块学习的一次性图像生成(OSG)生成对抗网络已引起广泛关注。近期研究主要聚焦于用纯卷积神经网络(CNNs)从概率分布输入中提取图像特征。然而,感受野有限的CNN很难提取并维持全局结构信息。因此,本文提出一种新颖的结构保持方法TcGAN,采用独立视觉Transformer以克服现有一次性图像生成方法的不足。具体而言,TcGAN在训练期间保持图像全局结构以兼容局部细节,同时利用transformer强大的长程依赖建模能力维持语义感知信息的完整性。我们还提出一种在计算过程中具有尺度不变性的新缩放公式,有效提升了OSG模型在图像超分辨率任务上的生成图像质量。我们给出了TcGAN转换器框架的设计、全面的实验及消融研究,证明了TcGAN以最快运行时间实现任意图像生成的能力。最后,TcGAN在应用于其他图像处理任务(如超分辨率与图像协调)时取得最优性能,结果进一步证明其优越性。

关键词

引用

@article{arxiv.2302.08047,
  title  = {TcGAN: Semantic-Aware and Structure-Preserved GANs with Individual Vision Transformer for Fast Arbitrary One-Shot Image Generation},
  author = {Yunliang Jiang and Lili Yan and Xiongtao Zhang and Yong Liu and Danfeng Sun},
  journal= {arXiv preprint arXiv:2302.08047},
  year   = {2023}
}