SpectralCLIP:从频谱视角防止文本引导风格迁移中的伪影
计算机视觉与模式识别
2023-11-07 v3
摘要
得益于视觉-语言基础模型(如CLIP)的能力,图像合成领域近期取得重要进展。尤其在风格迁移中,CLIP无需预先收集风格图像即可迁移更通用与抽象的风格,因为风格可用自然语言高效描述,且结果通过最小化文本描述与风格化图像间的CLIP相似度来优化。然而,直接使用CLIP引导风格迁移会导致不期望的伪影(主要为文字及无关视觉实体)散布于图像上。本文提出SpectralCLIP,其基于CLIP嵌入序列的频谱表示,其中大多数常见伪影占据特定频率。通过掩蔽包含这些频率的频带,我们可约束生成过程遵循目标风格属性(如颜色、纹理、笔触等),同时排除对应伪影的大尺度结构生成。实验结果表明,SpectralCLIP在定量与定性上均有效防止伪影生成,且不损害风格化质量。我们还将SpectralCLIP应用于文本条件图像生成,并显示其可防止生成图像中的文字。我们的代码见https://github.com/zipengxuc/SpectralCLIP。
引用
@article{arxiv.2303.09270,
title = {SpectralCLIP: Preventing Artifacts in Text-Guided Style Transfer from a Spectral Perspective},
author = {Zipeng Xu and Songlong Xing and Enver Sangineto and Nicu Sebe},
journal= {arXiv preprint arXiv:2303.09270},
year = {2023}
}
备注
WACV 2024