中文

利用单一 StyleGAN 实现通用域翻译:One-for-All

计算机视觉与模式识别 2024-12-10 v2

摘要

本文中,我们提出一种新颖的翻译模型 UniTranslator,用于在训练数据有限且视觉差异显著的条件下,在视觉迥异的域之间转换表征。我们方法背后的核心思想是利用 CLIP 的域中立能力作为桥接机制,同时使用一个独立模块从源域和目标域的嵌入中提取抽象的、与域无关语义。将这些抽象语义与目标特定语义融合,得到 CLIP 空间内变换后的嵌入。为弥合 CLIP 与 StyleGAN 这两个迥异世界之间的鸿沟,我们引入一种新的非线性映射器,即 CLIP2P 映射器。该模块利用 CLIP 嵌入来逼近 StyleGAN 潜空间中的潜分布,有效充当这两个空间之间的连接器。所提出的 UniTranslator 通用性强,能够执行多种任务,包括风格混合、风格化与翻译,即使在跨不同视觉域的极具挑战性的场景中也是如此。值得注意的是,UniTranslator 生成的高质量翻译展现出域相关性、多样性与改善的图像质量。UniTranslator 超越了现有通用模型的性能,并在代表性任务中表现优于专用模型。源代码与训练好的模型将公开发布。

关键词

引用

@article{arxiv.2310.14222,
  title  = {One-for-All: Towards Universal Domain Translation with a Single StyleGAN},
  author = {Yong Du and Jiahui Zhan and Xinzhe Li and Junyu Dong and Sheng Chen and Ming-Hsuan Yang and Shengfeng He},
  journal= {arXiv preprint arXiv:2310.14222},
  year   = {2024}
}