中文

无提示扩散:将“文本”从文本到图像扩散模型中移除

计算机视觉与模式识别 2023-06-02 v2

摘要

过去一年,得益于大规模预训练扩散模型及诸多新兴个性化与编辑方法,文本到图像(T2I)研究呈爆发式增长。然而,一个痛点持续存在:文本提示工程,且为定制结果搜索高质量文本提示更多依赖艺术而非科学。此外,常言道“一图胜千言”——用文本描述期望图像往往含糊不清,无法全面涵盖精细视觉细节,因而需要从视觉域引入更多额外控制。本文大胆向前一步:将“文本”从预训练 T2I 扩散模型中移除,以减轻用户繁重的提示工程负担。我们提出的框架 Prompt-Free Diffusion 仅依赖视觉输入生成新图像:它以参考图像作为“上下文”、可选的图像结构条件以及初始噪声作为输入,完全无需文本提示。幕后核心架构为语义上下文编码器(SeeCoder),替代常用的基于 CLIP 或 LLM 的文本编码器。SeeCoder 的可复用性也使其成为便捷的即插即用组件:人们可在一个 T2I 模型中预训练 SeeCoder,并复用于另一模型。大量实验表明,Prompt-Free Diffusion(i)优于先前的基于范例的图像合成方法;(ii)与使用遵循最佳实践提示的 SOTA T2I 模型表现相当;(iii)可自然扩展至动漫角色生成与虚拟试穿等其他下游应用,且质量可观。我们的代码与模型已开源:https://github.com/SHI-Labs/Prompt-Free-Diffusion。

关键词

引用

@article{arxiv.2305.16223,
  title  = {Prompt-Free Diffusion: Taking "Text" out of Text-to-Image Diffusion Models},
  author = {Xingqian Xu and Jiayi Guo and Zhangyang Wang and Gao Huang and Irfan Essa and Humphrey Shi},
  journal= {arXiv preprint arXiv:2305.16223},
  year   = {2023}
}

备注

Code, models and demos can be found through: https://github.com/SHI-Labs/Prompt-Free-Diffusion