Vit-GAN:基于 Vision Transformer 和条件 GAN 的图像到图像翻译
图像与视频处理
2021-10-19 v1 计算机视觉与模式识别
摘要
在本文中,我们开发了一种通用架构 Vit-Gan,能够执行从语义图像分割到单图像深度感知的大多数图像到图像翻译任务。本文是前序工作的后续论文,是对基于生成器模型 [1] 的扩展,其中获得的结果非常有前景。这开启了通过对抗架构进一步改进的可能性。我们使用了独特的基于 Vision Transformer 的生成器架构和带有 Markovian Discriminator (PatchGAN) 的 Conditional GAN (cGAN) (https://github.com/YigitGunduc/vit-gan)。在本文工作中,我们使用图像作为条件参数。观察到,所获得的结果比常用架构更为逼真。
引用
@article{arxiv.2110.09305,
title = {Vit-GAN: Image-to-image Translation with Vision Transformes and Conditional GANS},
author = {Yiğit Gündüç},
journal= {arXiv preprint arXiv:2110.09305},
year = {2021}
}