免费午餐的颜色-纹理解耦用于风格化图像生成
计算机视觉与模式识别
2025-12-15 v4
摘要
近期文本到图像(T2I)扩散模型的进展彻底改变了图像生成,使得仅使用少量风格参考图像即可实现显著的风格化生成进展。然而,当前的扩散方法在细粒度风格定制方面存在困难,原因在于难以控制多种风格属性,如颜色和纹理。本文提出了一种无需调优的方法,首次实现了风格化T2I生成中的免费午餐颜色-纹理解耦,解决了独立控制风格元素的需求,即解耦风格化图像生成(DisIG)问题。我们的方法利用CLIP图像嵌入空间中的图像提示可加性,开发了从单个颜色和纹理参考图像中分离和提取颜色-纹理嵌入(CTE)的技术。为确保生成图像的颜色调色板与颜色参考紧密对齐,我们应用了白化与着色变换以增强颜色一致性。此外,为防止扩散训练中固有的信号泄漏偏差导致的纹理丢失,我们引入了一个噪声项,在正则化白化与着色变换(RegWCT)过程中保持纹理保真度。通过这些方法,我们的风格属性解耦方法(SADis)为风格化图像生成提供了更精确和可定制的解决方案。在WikiArt和StyleDrop数据集上的实验表明,SADis在定性和定量上均超越了DisIG任务中最先进的风格化方法。代码已发布于 https://deepffff.github.io/sadis.github.io/。
引用
@article{arxiv.2503.14275,
title = {Free-Lunch Color-Texture Disentanglement for Stylized Image Generation},
author = {Jiang Qin and Senmao Li and Alexandra Gomez-Villa and Shiqi Yang and Yaxing Wang and Kai Wang and Joost van de Weijer},
journal= {arXiv preprint arXiv:2503.14275},
year = {2025}
}
备注
Accepted by NeurIPS2025. Code is available at https://deepffff.github.io/sadis.github.io/