CoT-Diff:逐步强化文本到图像生成
计算机视觉与模式识别
2025-07-08 v1
摘要
当前文本到图像(T2I)生成模型在空间构图与输入文本对齐方面存在挑战,尤其在复杂场景中。即使采用基于布局的方法,也会产生次优的空间控制,因为其生成过程与布局规划脱钩,难以在合成过程中细化布局。我们提出 CoT-Diff,一个将基于思维链(CoT)风格推理引入 T2I 生成的框架,通过紧密集成 Multimodal Large Language Model(MLLM)驱动的 3D 布局规划与扩散过程。CoT-Diff 使布局感知的推理在单个扩散轮次中实现:在每个去噪步骤中,MLLM 求值中间预测,动态更新 3D 场景布局,并持续指导生成过程。更新后的布局被转换为语义条件和深度图,这些条件通过条件感知注意力机制融合到扩散模型中,从而实现精确的空间控制和语义注入。在 3D 场景基准测试中实验表明,CoT-Diff 在空间对齐和构图保真度方面显著提升,相较于最先进的方法在复杂场景空间准确性上提升最高可达34.7%,从而验证了这种 entangled 生成范式的有效性。
引用
@article{arxiv.2507.04451,
title = {CoT-lized Diffusion: Let's Reinforce T2I Generation Step-by-step},
author = {Zheyuan Liu and Munan Ning and Qihui Zhang and Shuo Yang and Zhongrui Wang and Yiwei Yang and Xianzhe Xu and Yibing Song and Weihua Chen and Fan Wang and Li Yuan},
journal= {arXiv preprint arXiv:2507.04451},
year = {2025}
}