CleanStyle:面向文本到图像风格化的即插即用风格条件净化
计算机视觉与模式识别
2026-02-25 v1
摘要
扩散模型中的风格迁移通过注入参考图像的风格来实现可控的视觉生成。然而,recent 的编码器方法虽高效且无需调参,却常常出现内容泄漏,即风格图像的语义元素不期望地出现在输出中,影响提示保真度和风格一致性。在本工作中,我们引入 CleanStyle,一个无需重新训练即可从风格嵌入中过滤内容相关噪声的即插即用框架。基于经验分析,我们观察到这种泄漏主要源于风格嵌入的尾部组件,这些组件通过奇异值分解(SVD)被隔离。为此,我们提出了 CleanStyleSVD(CS-SVD),该方法使用基于时间的指数调度动态抑制尾部组件,为去噪过程中的干净、风格保护条件嵌入提供支持。此外,我们提出了风格特定的分类器自由指导(SS-CFG),该方法重用被抑制的尾部组件以构建风格感知的无条件输入。与常用通用负嵌入(如零向量)的常规方法不同,SS-CFG 引入反映风格特定但与提示无关的视觉元素的针对性负面信号。这使模型能够在生成过程中有效抑制这些令人分心的模式,从而提高提示保真度并提升风格化输出的整体视觉质量。我们的方法轻量、可解释,可无缝集成到现有的编码器方法扩散模型中而无需重新训练。广泛的实验表明,CleanStyle 在大幅度减少内容泄漏、提高风格化质量和改进提示对齐方面取得显著成果,涵盖广泛的风格参考和提示。
引用
@article{arxiv.2602.20721,
title = {CleanStyle: Plug-and-Play Style Conditioning Purification for Text-to-Image Stylization},
author = {Xiaoman Feng and Mingkun Lei and Yang Wang and Dingwen Fu and Chi Zhang},
journal= {arXiv preprint arXiv:2602.20721},
year = {2026}
}
备注
26 pages