ThinkGen:用于视觉生成的通用思考机制
计算机视觉与模式识别
2025-12-30 v1
摘要
多模态大语言模型(MLLMs)的最新进展表明,链式思维(Chain-of-Thought, CoT)推理能够系统性地解决复杂的理解任务。然而,其对生成任务的扩展仍处于初级阶段,且受限于场景特定机制,难以实现通用性和适应性。本文提出 ThinkGen,首个以思考驱动的视觉生成框架,显式地利用 MLLM 的 CoT 推理应用于各种生成场景。ThinkGen 采用解耦架构,包括预训练 MLLM 和扩散转换器(DiT),其中 MLLM 根据用户意图生成量身定制的指令,DiT 则依据这些指令生成高质量图像。我们进一步提出一种可分离的 GRPO 训练范式(SepGRPO),在 MLLM 和 DiT 模块之间交替进行强化学习。这一灵活的设计使其能够跨越多样数据集进行联合训练,实现广泛生成场景的有效 CoT 推理。大量实验表明,ThinkGen 在多个生成基准上实现了稳健、领先的性能。代码已公开:https://github.com/jiaosiyuu/ThinkGen
引用
@article{arxiv.2512.23568,
title = {ThinkGen: Generalized Thinking for Visual Generation},
author = {Siyu Jiao and Yiheng Lin and Yujie Zhong and Qi She and Wei Zhou and Xiaohan Lan and Zilong Huang and Fei Yu and Yingchen Yu and Yunqing Zhao and Yao Zhao and Yunchao Wei},
journal= {arXiv preprint arXiv:2512.23568},
year = {2025}
}