LLMControl:基于多模态 LLM 的文本到图像扩散合成 grounded 控制
计算机视觉与模式识别
2025-07-29 v1
摘要
近期的文本到图像 (Text-to-Image, T2I) 扩散模型空间控制方法取得了令人瞩目的成果。然而,这些方法在面对包含多个物体或具有复杂空间构成的文本提示时,仍难以精确遵循控制条件并生成相应图像。在本工作中,我们提出一种称为 LLM_Control 的 LLM 指导框架,以解决可控 T2I 生成任务的挑战。通过提升 grounding 能力,LLM_Control 被引入到预训练扩散模型中,使视觉条件与文本提示在结构和外观生成方面形成互补。我们利用多模态 LLM 作为全局控制器,对空间布局进行安排、补充语义描述并绑定物体属性。获得的控制信号被注入到去噪网络中,依据新的采样约束重新聚焦和增强注意力图。广泛的定性和定量实验表明,LLM_Control 在 various 预训练 T2I 模型上实现了与其他最先进方法相媲美的合成质量。值得注意的是,LLM_Control 能够处理大多数现有方法难以应对的挑战性输入条件。
引用
@article{arxiv.2507.19939,
title = {LLMControl: Grounded Control of Text-to-Image Diffusion-based Synthesis with Multimodal LLMs},
author = {Jiaze Wang and Rui Chen and Haowang Cui},
journal= {arXiv preprint arXiv:2507.19939},
year = {2025}
}