面向风格驱动生成的风格友好信噪比采样器
计算机视觉与模式识别
2025-03-21 v3
摘要
最近的文本到图像扩散模型生成高质量图像,但在学习新型、个人化风格方面存在困难,这限制了独特风格模板的创建。在风格驱动生成中,用户通常提供示范所需风格的参考图像,同时提供指定所需风格属性的文本提示。以往方法广泛依赖微调,但往往盲目利用预训练时的目标函数和噪声水平分布,而未进行适应。我们发现,风格特征主要在较高噪声水平上出现,导致当前微调方法在风格对齐方面表现次优。我们提出风格友好 SNR 采样器,在微调期间积极将信噪比 (SNR) 分布向更高的噪声水平倾斜,以聚焦于风格特征出现的噪声水平。这增强了模型捕获由参考图像和文本提示指示的新型风格的能力。我们展示了 improved generation of novel styles that cannot be adequately described solely with a text prompt, enabling the creation of new style templates for personalized content creation. 我们演示了能够生成无法仅通过文本提示充分描述的新型风格,从而实现针对个性化内容创建的新型风格模板。
引用
@article{arxiv.2411.14793,
title = {Style-Friendly SNR Sampler for Style-Driven Generation},
author = {Jooyoung Choi and Chaehun Shin and Yeongtak Oh and Heeseung Kim and Jungbeom Lee and Sungroh Yoon},
journal= {arXiv preprint arXiv:2411.14793},
year = {2025}
}
备注
Project page: https://stylefriendly.github.io/