中文

面向扩散Transformer的无训练区域提示

计算机视觉与模式识别 2024-11-05 v1

摘要

扩散模型在文本到图像生成中展现了卓越的能力。借助大型语言模型(如T5、Llama),其语义理解(即提示遵循)能力也得到了极大提升。然而,现有模型无法完美处理长且复杂的文本提示,尤其是当文本提示包含具有众多属性和相互空间关系的各种对象时。尽管针对基于UNet的模型(SD1.5、SDXL)已提出了许多区域提示方法,但基于近期扩散Transformer(DiT)架构(如SD3和FLUX.1)的实现仍然缺失。在本报告中,我们基于注意力操纵为FLUX.1提出并实现了区域提示,使DiT以无需训练的方式具备细粒度组合式文本到图像生成能力。代码可在https://github.com/antonioo-c/Regional-Prompting-FLUX获取。

关键词

引用

@article{arxiv.2411.02395,
  title  = {Training-free Regional Prompting for Diffusion Transformers},
  author = {Anthony Chen and Jianjin Xu and Wenzhao Zheng and Gaole Dai and Yida Wang and Renrui Zhang and Haofan Wang and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2411.02395},
  year   = {2024}
}

备注

Code is available at https://github.com/antonioo-c/Regional-Prompting-FLUX