中文

用于多模态图像合成的级联模块化网络(CAM-Net)

计算机视觉与模式识别 2021-06-18 v1 机器学习

摘要

诸如 GAN 之类的深度生成模型近年来推动了条件图像合成领域的显著进展。一个长期存在的挑战是从同一输入图像生成多样化版本的输出图像,这是由于模式崩溃问题:由于每个输入图像仅给出一张真实输出图像,因此仅建模了条件分布的一种模式。本文聚焦于多模态条件图像合成这一难题,并基于近期提出的隐式最大似然估计(IMLE)技术展开。先前的基于 IMLE 的方法针对不同任务需采用不同架构,限制了其适用性,且生成图像缺乏精细细节。我们提出 CAM-Net,一种可广泛应用于各类任务的统一架构。此外,它能够生成令人信服的高频细节,与基线相比将弗雷歇初始距离(FID)降低了至多 45.3%。

关键词

引用

@article{arxiv.2106.09015,
  title  = {Cascading Modular Network (CAM-Net) for Multimodal Image Synthesis},
  author = {Shichong Peng and Alireza Moazeni and Ke Li},
  journal= {arXiv preprint arXiv:2106.09015},
  year   = {2021}
}

备注

Videos available as ancillary files