BoxDiff:基于无训练框约束扩散的文本到图像合成
计算机视觉与模式识别
2023-08-22 v4
摘要
近期文本到图像扩散模型已展现出生成高质量图像的惊人能力。然而,研究者主要研究了仅用文本提示合成图像的方式。尽管有些工作探索了使用其他模态作为条件,但培育模型需要大量成对数据(如框/掩码-图像对)和微调时间。由于此类成对数据获取耗时费力且限于封闭集合,这潜在成为开放世界应用的瓶颈。本文关注用户提供的条件最简单形式,如框或涂鸦。为缓解上述问题,我们提出一种无训练方法,以控制合成图像中物体与上下文遵从给定空间条件。具体而言,设计并无缝集成三种空间约束(即内框、外框与角点约束)到扩散模型的去噪步骤中,无需额外训练与海量标注布局数据。大量实验结果表明,所提约束能控制图像中呈现的内容与位置,同时保留扩散模型以高保真与多样概念覆盖合成的能力。代码公开于 https://github.com/showlab/BoxDiff。
引用
@article{arxiv.2307.10816,
title = {BoxDiff: Text-to-Image Synthesis with Training-Free Box-Constrained Diffusion},
author = {Jinheng Xie and Yuexiang Li and Yawen Huang and Haozhe Liu and Wentian Zhang and Yefeng Zheng and Mike Zheng Shou},
journal= {arXiv preprint arXiv:2307.10816},
year = {2023}
}
备注
Accepted by ICCV 2023. Code is available at: https://github.com/showlab/BoxDiff