中文

基于隐空间能量传输的无配对图像到图像翻译

计算机视觉与模式识别 2021-05-25 v3 机器学习 机器学习

摘要

图像到图像翻译旨在保留源内容的同时,在两个视觉域之间翻译为具判别性的目标风格。多数工作在原始图像空间中采用对抗学习,这可能计算昂贵且难以训练。在本文中,我们提出在预训练自编码器的隐空间中部署能量基模型(EBM)来完成该任务。预训练自编码器既作为隐码提取器,也作为图像重建器。我们的模型LETIT基于两个域共享同一隐空间的假设,其中隐表示被隐式分解为内容码与域特定风格码。与显式提取两种码并应用自适应实例归一化将其结合不同,我们的隐空间EBM能够隐式学习在保留内容码的同时将源风格码传输至目标风格码,这是优于现有图像翻译方法的优势。这一简化方案在单边无配对图像翻译设定中也更高效。定性与定量比较展示了更优的翻译质量与内容保留保真度。据我们所知,我们的模型首个适用于1024×\times1024分辨率的无配对图像翻译。

关键词

引用

@article{arxiv.2012.00649,
  title  = {Unpaired Image-to-Image Translation via Latent Energy Transport},
  author = {Yang Zhao and Changyou Chen},
  journal= {arXiv preprint arXiv:2012.00649},
  year   = {2021}
}

备注

CVPR2021. Code: https://github.com/YangNaruto/latent-energy-transport