中文

计算机视觉中基于 Transformer 的生成对抗网络:综述

计算机视觉与模式识别 2023-02-20 v1 图像与视频处理

摘要

生成对抗网络 (GANs) 在给定数据集中合成图像方面已非常成功。GANs 人工生成的图像极为逼真。GANs 已在若干计算机视觉应用中展现出潜在用途,包括图像生成、图像到图像翻译、视频合成等。传统上,生成器网络是 GANs 的主干,其生成样本,判别器网络用于辅助生成器网络的训练。判别器网络通常为卷积神经网络 (CNN)。而生成器网络通常为用于图像生成的上采样 CNN 或用于图像到图像翻译的编码器-解码器网络。基于卷积的网络利用层中的局部关系,需深层网络以提取抽象特征。因此,CNNs 难以利用特征空间中的全局关系。然而,近期发展的 Transformer 网络能够在每一层利用全局关系。Transformer 网络已在计算机视觉的若干问题上展现出巨大性能提升。受 Transformer 网络与 GANs 成功的启发,近期工作尝试在 GAN 框架中利用 Transformer 进行图像/视频合成。本文对利用 Transformer 网络用于计算机视觉应用的 GANs 的发展与进展进行了全面综述。同时,在基准数据集上对若干应用进行了性能比较与分析。本综述将非常有助于深度学习与计算机视觉领域理解基于 Transformer 的 GANs 相关研究趋势与空白,并通过利用全局与局部关系为不同应用开发先进的 GAN 架构。

关键词

引用

@article{arxiv.2302.08641,
  title  = {Transformer-based Generative Adversarial Networks in Computer Vision: A Comprehensive Survey},
  author = {Shiv Ram Dubey and Satish Kumar Singh},
  journal= {arXiv preprint arXiv:2302.08641},
  year   = {2023}
}