SGDiff:一种用于时尚图像生成的风格引导扩散模型
计算机视觉与模式识别
2023-08-16 v1 人工智能
多媒体
摘要
本文报道了一种新颖的风格引导扩散模型(SGDiff)的开发,该模型克服了现有图像生成模型中某些固有的弱点。所提出的 SGDiff 将图像模态与预训练的文本到图像扩散模型相结合,以促进创意时尚图像生成。它通过引入补充的风格引导,解决了文本到图像扩散模型的局限性,大幅降低了训练成本,并克服了仅用文本输入控制生成风格的困难。本文还引入了一个新数据集——SG-Fashion,专为时尚图像生成应用设计,提供高分辨率图像和广泛的服装类别。通过全面的消融研究,我们考察了无分类器引导(classifier-free guidance)对多种条件的应用,并验证了所提模型在生成所需类别、产品属性和风格的时尚图像方面的有效性。本文的贡献包括:一种用于多模态特征融合的新颖无分类器引导方法、一个用于时尚图像生成应用的综合数据集、对条件文本到图像生成的深入探究,以及对文本到图像生成领域未来研究的宝贵见解。代码与数据集可在:\url{https://github.com/taited/SGDiff} 获取。
引用
@article{arxiv.2308.07605,
title = {SGDiff: A Style Guided Diffusion Model for Fashion Synthesis},
author = {Zhengwentai Sun and Yanghong Zhou and Honghong He and P. Y. Mok},
journal= {arXiv preprint arXiv:2308.07605},
year = {2023}
}
备注
Accepted by ACM MM'23