Ranni:驯服文本到图像扩散模型以实现精确指令跟随
计算机视觉与模式识别
2024-04-10 v3
摘要
现有的文本到图像(T2I)扩散模型通常难以解读复杂提示,尤其是那些包含数量、对象-属性绑定和多主体描述的情况。在本工作中,我们引入一个语义面板作为文本解码为图像的中间件,支持生成器更好地遵循指令。该面板借助大语言模型对输入文本解析出的视觉概念进行排列而获得,随后作为详细的控制信号注入去噪网络以补充文本条件。为促进文本到面板的学习,我们提出了精心设计的语义格式化协议,并配套了全自动的数据准备流程。得益于这样的设计,我们称之为 Ranni 的方法得以增强预训练 T2I 生成器的文本可控性。更重要的是,生成式中间件的引入带来了更便捷的交互形式(即直接调整面板中的元素或使用语言指令),并进一步允许用户精细定制其生成结果;基于此我们开发了一个实用系统,并展示了其在连续生成和基于对话的编辑方面的潜力。我们的项目页面位于 https://ranni-t2i.github.io/Ranni。
引用
@article{arxiv.2311.17002,
title = {Ranni: Taming Text-to-Image Diffusion for Accurate Instruction Following},
author = {Yutong Feng and Biao Gong and Di Chen and Yujun Shen and Yu Liu and Jingren Zhou},
journal= {arXiv preprint arXiv:2311.17002},
year = {2024}
}