中文

我们可以用 CoT 生成图像吗?让我们逐步验证并强化图像生成

计算机视觉与模式识别 2025-07-24 v2 人工智能 计算与语言

摘要

链条思维(CoT)推理在大型模型中被广泛探索,以解决复杂理解任务。然而,如何将此策略应用于验证和强化图像生成场景仍是一个开放问题。本文提供了首次全面调查 CoT 推理潜力以增强自回归图像生成的可能性。我们关注三种技术:扩展测试时计算以进行验证、将模型偏好与直接偏好优化(DPO)对齐,以及将这些技术集成以实现互补效果。我们的结果表明,这些方法可以有效地适应和组合,以显著提高图像生成性能。此外,鉴于奖励模型在我们发现中的关键作用,我们提出了潜力评估奖励模型(PARM)和 PARM++,专为自回归图像生成设计。PARM 通过潜力评估方法自适应评估每个生成步骤,融合现有奖励模型的优势,而 PARM++ 进一步引入反思机制,以自我纠正生成的不满意图像,这是首个在自回归图像生成中 incorporates 反思机制。使用我们调查的推理策略,我们增强了基线模型 Show-o,以实现优异结果,在 GenEval 基准上实现显著的 +24% 改进,超越 Stable Diffusion 3 后 +15%。我们希望我们的研究提供独特见解并为将 CoT 推理与自回归图像生成集成铺平新道路。代码和模型已发布于 https://github.com/ZiyuGuo99/Image-Generation-CoT

关键词

引用

@article{arxiv.2501.13926,
  title  = {Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step},
  author = {Ziyu Guo and Renrui Zhang and Chengzhuo Tong and Zhizheng Zhao and Rui Huang and Haoquan Zhang and Manyuan Zhang and Jiaming Liu and Shanghang Zhang and Peng Gao and Hongsheng Li and Pheng-Ann Heng},
  journal= {arXiv preprint arXiv:2501.13926},
  year   = {2025}
}

备注

Journal Version. Code and models are released at https://github.com/ZiyuGuo99/Image-Generation-CoT