中文

面向增强型扩散文本到图像生成的任意风格引导

计算机视觉与模式识别 2022-11-16 v1 图像与视频处理

摘要

基于扩散的文本到图像生成模型如 GLIDE 和 DALLE-2 近期因其将复杂文本输入转化为高质量、高多样性图像的优越性能而获得广泛成功。特别是,它们被证明在创建各种格式与风格的图形艺术方面非常强大。尽管当前模型支持指定油画或铅笔画等风格格式,但诸如颜色分布和笔触之类的细粒度风格特征难以指定,因为它们是基于给定文本输入从条件分布中随机选取的。在此我们提出一种新颖的风格引导方法,支持利用参考图像引导的任意风格生成图像。该生成方法不需要单独的风格迁移模型来生成所需风格,同时维持由文本输入控制所生成内容中的图像质量。此外,该引导方法可在无风格参考下应用,称为自风格引导,以生成更具多样风格的图像。综合实验证明所提方法在广泛条件下保持鲁棒与有效,包括多样的图形艺术形式、图像内容类型与扩散模型。

关键词

引用

@article{arxiv.2211.07751,
  title  = {Arbitrary Style Guidance for Enhanced Diffusion-Based Text-to-Image Generation},
  author = {Zhihong Pan and Xin Zhou and Hao Tian},
  journal= {arXiv preprint arXiv:2211.07751},
  year   = {2022}
}

备注

To appear at WACV 2023