中文

基于互信息估计与最大化的多模态图像到图像翻译

计算机视觉与模式识别 2021-05-11 v7 机器学习 图像与视频处理 机器学习

摘要

多模态图像到图像翻译(I2IT)旨在学习一个条件分布,该分布在给定源域中一张输入图像时探索目标域中的多个可能图像。条件生成对抗网络(cGANs)常被用于建模此类条件分布。然而,cGANs 在条件图像合成中容易忽略潜码并学习单模态分布,这也被称为 GANs 的模式崩溃问题。为解决该问题,本文提出一种简单而有效的方法,通过使用深度互信息神经估计器,在 cGANs 中显式估计并最大化潜码与输出图像之间的互信息。最大化互信息增强了潜码与输出图像之间的统计依赖性,从而防止生成器忽略潜码,并鼓励 cGANs 充分利用潜码来合成多样化结果。我们的方法不仅从信息论角度为提升 I2IT 的多样性提供了新视角,还额外实现了源域内容与目标域风格之间的解耦。

关键词

引用

@article{arxiv.2008.03529,
  title  = {Multimodal Image-to-Image Translation via Mutual Information Estimation and Maximization},
  author = {Zhiwen Zuo and Lei Zhao and Zhizhong Wang and Haibo Chen and Ailin Li and Qijiang Xu and Wei Xing and Dongming Lu},
  journal= {arXiv preprint arXiv:2008.03529},
  year   = {2021}
}