分而治之:语言模型能够规划并自我修正组合式文本到图像生成
计算机视觉与模式识别
2024-01-31 v2
摘要
尽管文本到图像模型在生成高质量图像方面取得了显著进展,但在复杂文本提示的情境下,这些方法仍难以确保文本提示对图像的可控性,尤其是在保留对象属性和关系方面。在本文中,我们提出了 CompAgent,一种用于组合式文本到图像生成的免训练方法,以大型语言模型(LLM)智能体为核心。CompAgent 的基本思想基于分而治之的方法。给定包含对象、属性和关系等多个概念的复杂文本提示,LLM 智能体首先将其分解,包括提取单个对象及其关联属性,并预测连贯的场景布局。随后可以独立攻克这些单个对象。接着,智能体通过分析文本进行推理,规划并使用工具来组合这些孤立的对象。最后,我们将验证和人类反馈机制纳入我们的智能体中,以进一步纠正潜在的属性错误并优化生成的图像。在 LLM 智能体的引导下,我们提出了一个免调优的多概念定制模型和一个布局到图像生成模型作为概念组合的工具,以及一个局部图像编辑方法作为与智能体交互以进行验证的工具。场景布局在这些工具中控制图像生成过程,以防止多个对象之间的混淆。大量实验证明了我们的方法在组合式文本到图像生成方面的优越性:CompAgent 在 T2I-CompBench(一个针对开放世界组合式 T2I 生成的综合基准)上取得了超过 10% 的提升。向各种相关任务的扩展也说明了我们的 CompAgent 在潜在应用中的灵活性。
引用
@article{arxiv.2401.15688,
title = {Divide and Conquer: Language Models can Plan and Self-Correct for Compositional Text-to-Image Generation},
author = {Zhenyu Wang and Enze Xie and Aoxue Li and Zhongdao Wang and Xihui Liu and Zhenguo Li},
journal= {arXiv preprint arXiv:2401.15688},
year = {2024}
}