中文

FlexIT:迈向灵活语义图像翻译

计算机视觉与模式识别 2022-03-10 v1

摘要

深度生成模型(如 GAN)显著提升了图像合成的艺术水平,并能在人脸等结构化域中生成近乎照片级真实的图像。基于此成功,近期图像编辑工作通过将图像投影到 GAN 潜空间并操纵潜向量来进行。然而,这些方法存在局限:仅能转换狭窄域内的图像,且编辑操作数量有限。我们提出 FlexIT,一种可接收任意输入图像与用户自定义文本编辑指令的新方法。我们的方法实现了灵活自然的编辑,推动了语义图像翻译的边界。首先,FlexIT 将输入图像与文本融合为 CLIP 多模态嵌入空间中的单个目标点。通过自编码器的潜空间,我们迭代地将输入图像向目标点变换,并利用多种新颖正则项确保一致性与质量。我们提出了一种语义图像翻译的评估协议,并在 ImageNet 上对我们的方法进行了详尽评估。代码将公开可用。

关键词

引用

@article{arxiv.2203.04705,
  title  = {FlexIT: Towards Flexible Semantic Image Translation},
  author = {Guillaume Couairon and Asya Grechka and Jakob Verbeek and Holger Schwenk and Matthieu Cord},
  journal= {arXiv preprint arXiv:2203.04705},
  year   = {2022}
}

备注

accepted at CVPR 2022