ArtWeaver:基于扩散模型的高级动态风格集成
计算机视觉与模式识别
2024-11-19 v2
摘要
风格化文本到图像生成(Stylized Text-to-Image Generation, STIG)旨在从文本提示和风格参考图像生成图像。本文提出ArtWeaver框架,利用预训练的Stable Diffusion(SD)模型解决风格被误解和语义不一致等挑战。我们的方法引入两个创新模块:混合风格描述符和动态注意力适配器。混合风格描述符通过结合来自CLIP的内容感知嵌入和频率解缝嵌入,以及捕获全局统计信息和文本信息的额外来源,增强了SD模型,提供了更丰富的风格相关和语义相关知识。为实现适配器容量与语义控制之间的更好平衡,动态注意力适配器被集成到扩散UNet中,基于风格描述符动态计算适应权重。此外,我们引入两个目标函数在去噪损失之外优化模型,进一步增强了语义和风格的一致性。大量实验表明,ArtWeaver在现有方法之上具有优势,能够生成多样化的目标风格图像,同时保持文本提示的语义完整性。
引用
@article{arxiv.2405.15287,
title = {ArtWeaver: Advanced Dynamic Style Integration via Diffusion Model},
author = {Chengming Xu and Kai Hu and Qilin Wang and Donghao Luo and Jiangning Zhang and Xiaobin Hu and Yanwei Fu and Chengjie Wang},
journal= {arXiv preprint arXiv:2405.15287},
year = {2024}
}