UVCGAN:用于非配对图像到图像翻译的 UNet Vision Transformer 循环一致 GAN
计算机视觉与模式识别
2022-10-19 v3 图像与视频处理
摘要
非配对图像到图像翻译在艺术、设计与科学模拟中有广泛应用。早期的一项突破是 CycleGAN,它通过生成对抗网络(GAN)结合循环一致性约束强调两个非配对图像域之间的一对一映射,而更近期的工作提倡一对多映射以提升翻译图像的多样性。受科学模拟与一对一需求驱动,本工作重访经典 CycleGAN 框架,并在不放松循环一致性约束的情况下提升其性能以超越更现代的模型。为此,我们为生成器配备 Vision Transformer (ViT) 并采用必要的训练与正则化技术。与先前性能最佳的模型相比,我们的模型表现更优,并在原始图像与翻译图像间保持强相关性。一项伴随的消融研究表明,梯度惩罚与自监督预训练对改进都至关重要。为促进可复现性与开放科学,源代码、超参数配置与预训练模型可在 https://github.com/LS4GAN/uvcgan 获取。
引用
@article{arxiv.2203.02557,
title = {UVCGAN: UNet Vision Transformer cycle-consistent GAN for unpaired image-to-image translation},
author = {Dmitrii Torbunov and Yi Huang and Haiwang Yu and Jin Huang and Shinjae Yoo and Meifeng Lin and Brett Viren and Yihui Ren},
journal= {arXiv preprint arXiv:2203.02557},
year = {2022}
}
备注
Accepted by WACV2023, contains 5 pages, 2 figures, 2 tables