中文

GoT:释放多模态大语言模型在视觉生成与编辑中的推理能力

计算机视觉与模式识别 2025-03-14 v1

摘要

目前的图像生成与编辑方法主要将文本提示作为直接输入,而不进行视觉组合与显式操作的推理。我们提出生成链式思维(Generation Chain-of-Thought, GoT),一种新颖的范式,通过在输出图像之前进行显式的语言推理过程来实现生成与编辑。该方法将传统的文本到图像生成与编辑转化为一个由推理引导的框架,分析语义关系与空间排列。我们定义了 GoT 的形式化方法,并构建了包含超过 900 万样本的大规模 GoT 数据集,其中包含捕获语义-空间关系的详细推理链。为了利用 GoT 的优势,我们实现了一个统一框架,将用于推理链生成的 Qwen2.5-VL 与由我们新颖的语义-空间引导模块增强的端到端扩散模型相结合。实验表明,我们的 GoT 框架在生成与编辑任务上均取得了优异性能,相比基线方法有显著提升。此外,我们的方法支持交互式视觉生成,允许用户显式修改推理步骤以进行精确的图像调整。GoT 开创了推理驱动的视觉生成与编辑的新方向,产生的图像更好地契合人类意图。为促进未来研究,我们将数据集、代码和预训练模型公开发布于 https://github.com/rongyaofang/GoT。

关键词

引用

@article{arxiv.2503.10639,
  title  = {GoT: Unleashing Reasoning Capability of Multimodal Large Language Model for Visual Generation and Editing},
  author = {Rongyao Fang and Chengqi Duan and Kun Wang and Linjiang Huang and Hao Li and Shilin Yan and Hao Tian and Xingyu Zeng and Rui Zhao and Jifeng Dai and Xihui Liu and Hongsheng Li},
  journal= {arXiv preprint arXiv:2503.10639},
  year   = {2025}
}

备注

Dataset and models are released in https://github.com/rongyaofang/GoT