中文

改进多对一图像到图像翻译的深度生成模型

计算机视觉与模式识别 2024-02-26 v2 机器学习

摘要

深度生成模型已应用于图像到图像翻译的多种场景。生成对抗网络(GAN)和扩散模型(Diffusion Models)在此类任务上取得了令人瞩目的成果,树立了新的 state-of-the-art(SOTA)基准。大多数方法在数据集的不同域之间采用对称设置,假设所有域要么具有多种模态,要么仅具有一种模态。然而,许多数据集的两个域之间存在多对一关系。在本文中,我们首先引入了一个 Colorized MNIST 数据集和一个 Color-Recall 评分,为评估多对一翻译模型提供了一个简单的基准。随后,我们提出了一种新的非对称框架,以改进现有的深度生成模型在多对一图像到图像翻译任务上的表现。我们将该框架应用于 StarGAN V2,并表明在无监督和半监督设置下,新模型在多对一图像到图像翻译任务上的性能均有所提升。

关键词

引用

@article{arxiv.2402.12531,
  title  = {Improving Deep Generative Models on Many-To-One Image-to-Image Translation},
  author = {Sagar Saxena and Mohammad Nayeem Teli},
  journal= {arXiv preprint arXiv:2402.12531},
  year   = {2024}
}

备注

11 pages, 6 figures; template format corrected