面向增强型扩散文本到图像生成的任意风格引导
计算机视觉与模式识别
2022-11-16 v1 图像与视频处理
摘要
基于扩散的文本到图像生成模型如 GLIDE 和 DALLE-2 近期因其将复杂文本输入转化为高质量、高多样性图像的优越性能而获得广泛成功。特别是,它们被证明在创建各种格式与风格的图形艺术方面非常强大。尽管当前模型支持指定油画或铅笔画等风格格式,但诸如颜色分布和笔触之类的细粒度风格特征难以指定,因为它们是基于给定文本输入从条件分布中随机选取的。在此我们提出一种新颖的风格引导方法,支持利用参考图像引导的任意风格生成图像。该生成方法不需要单独的风格迁移模型来生成所需风格,同时维持由文本输入控制所生成内容中的图像质量。此外,该引导方法可在无风格参考下应用,称为自风格引导,以生成更具多样风格的图像。综合实验证明所提方法在广泛条件下保持鲁棒与有效,包括多样的图形艺术形式、图像内容类型与扩散模型。
引用
@article{arxiv.2211.07751,
title = {Arbitrary Style Guidance for Enhanced Diffusion-Based Text-to-Image Generation},
author = {Zhihong Pan and Xin Zhou and Hao Tian},
journal= {arXiv preprint arXiv:2211.07751},
year = {2022}
}
备注
To appear at WACV 2023