CSGO:文本到图像生成中的内容-风格组合
计算机视觉与模式识别
2024-09-05 v2
摘要
扩散模型在可控图像生成方面展现出了卓越的能力,这进一步激发了人们对图像风格迁移的兴趣。由于特定数据的稀缺,现有工作主要聚焦于免训练方法(例如图像反演)。在本研究中,我们提出了一条用于内容-风格-风格化图像三元组的数据构建流水线,该流水线可生成并自动清洗风格化数据三元组。基于此流水线,我们构建了数据集 IMAGStyle,这是首个包含 21 万个图像三元组的大规模风格迁移数据集,可供社区探索与研究。依托 IMAGStyle,我们提出了 CSGO,一种基于端到端训练的风格迁移模型,它通过独立的特征注入显式地解耦内容与风格特征。统一的 CSGO 实现了图像驱动的风格迁移、文本驱动的风格化合成以及文本编辑驱动的风格化合成。大量实验证明了我们的方法在增强图像生成中的风格控制能力方面的有效性。更多可视化与源代码访问请参见项目页面:\url{https://csgo-gen.github.io/}。
引用
@article{arxiv.2408.16766,
title = {CSGO: Content-Style Composition in Text-to-Image Generation},
author = {Peng Xing and Haofan Wang and Yanpeng Sun and Qixun Wang and Xu Bai and Hao Ai and Renyuan Huang and Zechao Li},
journal= {arXiv preprint arXiv:2408.16766},
year = {2024}
}