中文

基于 GPT-4 的可控文本到图像生成

计算机视觉与模式识别 2023-05-31 v1 人工智能

摘要

当前的文本到图像生成模型往往难以遵循文本指令,尤其是需要空间推理的指令。另一方面,大型语言模型(LLMs),如 GPT-4,在生成用于图形化勾勒文本输入的代码片段(例如通过 TikZ)方面表现出卓越的精确性。在本工作中,我们引入 Control-GPT,以 GPT-4 生成的程序化草图来引导基于扩散的文本到图像流水线,增强其指令遵循能力。Control-GPT 通过查询 GPT-4 编写 TikZ 代码来工作,生成的草图与文本指令一起作为扩散模型(如 ControlNet)生成照片级真实图像的参考。训练我们流水线的一大挑战是缺乏包含对齐文本、图像与草图的数据集。我们通过将现有数据集中的实例掩码转换为多边形以模拟测试时使用的草图来解决该问题。结果表明,Control-GPT 极大提升了图像生成的可控性。它在空间排布与物体定位生成上确立了新的 SOTA,并增强了用户对物体位置、大小等的控制,准确率近乎翻倍于先前模型。我们的工作作为首次尝试,展示了利用 LLMs 提升计算机视觉任务性能的潜力。

关键词

引用

@article{arxiv.2305.18583,
  title  = {Controllable Text-to-Image Generation with GPT-4},
  author = {Tianjun Zhang and Yi Zhang and Vibhav Vineet and Neel Joshi and Xin Wang},
  journal= {arXiv preprint arXiv:2305.18583},
  year   = {2023}
}