中文

利用条件感知器提升图像翻译质量

计算机视觉与模式识别 2021-10-14 v1 人工智能

摘要

多模态域翻译通常指合成一幅新图像,其从“内容”图像继承某些局部属性(如布局、语义或几何),并从“风格”图像继承其余一切(如纹理、光照,有时甚至语义)。该任务的主流方法是试图从零学习解耦的“内容”与“风格”表示。然而,这不仅具有挑战性,而且是不适定的,因为用户在翻译中希望保留的内容随其目标而异。受此固有模糊性驱动,我们基于现成预训练模型提取的条件信息来定义“内容”。随后,我们以一组易于优化的重建目标训练风格提取器与图像解码器。可用的高质量预训练模型种类繁多且训练流程简单,使我们的方法可直接应用于众多域及不同的“内容”定义。此外,它还对跨域保留哪些“内容”方面提供了直观控制。我们在传统、对齐良好的数据集(如CelebA-HQ)上评估了我们的方法,并提出了两个用于更复杂场景评估的新数据集:ClassicTV与FFHQ-Wild。我们的方法Sensorium能够为更复杂场景实现更高质量的域翻译。

关键词

引用

@article{arxiv.2110.06443,
  title  = {Harnessing the Conditioning Sensorium for Improved Image Translation},
  author = {Cooper Nederhood and Nicholas Kolkin and Deqing Fu and Jason Salavon},
  journal= {arXiv preprint arXiv:2110.06443},
  year   = {2021}
}