基于解耦风格与内容表示的扩散图像翻译方法
计算机视觉与模式识别
2023-02-02 v2 人工智能
机器学习
机器学习
摘要
由语义文本或单张目标图像引导的基于扩散的图像翻译已实现灵活的风格迁移,且不受特定领域限制。遗憾的是,由于扩散模型的随机性,在反向扩散过程中往往难以保持图像的原始内容。为此,我们提出一种新颖的基于扩散的无监督图像翻译方法,利用解耦的风格与内容表示。具体而言,受拼接视觉Transformer启发,我们从 ViT 模型的多头自注意力层中提取中间键,并将其用作内容保持损失。随后,通过匹配去噪样本与目标图像的 [CLS] 分类令牌执行图像引导的风格迁移,而额外的 CLIP 损失用于文本驱动的风格迁移。为进一步加速反向扩散过程中的语义变化,我们还提出一种新颖的语义散度损失与重采样策略。实验结果表明,所提方法在文本引导与图像引导的翻译任务中均优于最先进的基线模型。
引用
@article{arxiv.2209.15264,
title = {Diffusion-based Image Translation using Disentangled Style and Content Representation},
author = {Gihyun Kwon and Jong Chul Ye},
journal= {arXiv preprint arXiv:2209.15264},
year = {2023}
}
备注
ICLR 2023 camera ready