深入探讨 RL 在图像生成中的 CoT 应用:DPO 与 GRPO 的比较研究
计算机视觉与模式识别
2025-06-11 v2 人工智能
计算与语言
机器学习
摘要
近期的技术进步凸显了强化学习 (RL) 在提升大型语言模型 (LLM) 链条思维 (CoT) 推理能力方面的重要作用。直接偏好优化 (DPO) 和群体相对策略优化 (GRPO) 作为两种突出的 RL 算法,展示了各自的优势与不足。自回归图像生成——亦可解释为顺序 CoT 推理过程——呈现出独特挑战,不同于基于 LLM 的 CoT 推理。这包括确保文本与图像的一致性、提升图像审美质量,以及设计复杂的奖励模型,而非依赖简单规则奖励。尽管近期努力将 RL 扩展至此领域,但这些探索通常缺乏对领域特定挑战以及不同 RL 策略特征的深入分析。为弥合这一差距,本文提供了对 GRPO 和 DPO 在自回归图像生成中的全面考察,评估其在域内表现与域外泛化能力,同时审视了不同奖励模型对其能力的影响。我们的发现表明,GRPO 和 DPO 各具优势,关键在于,具备更强内在泛化能力的奖励模型可能提升所应用 RL 算法的泛化潜力。此外,我们系统性地探讨了三种常见的扩展策略,以提升两者在域内及域外的性能,为每种范式高效扩展性能提供了独特见解。我们希望本研究为激发未来工作,开发更有效的 RL 算法以实现自回归图像生成中稳健的 CoT 推理,提供新路径。代码已发布于 https://github.com/ZiyuGuo99/Image-Generation-CoT
引用
@article{arxiv.2505.17017,
title = {Delving into RL for Image Generation with CoT: A Study on DPO vs. GRPO},
author = {Chengzhuo Tong and Ziyu Guo and Renrui Zhang and Wenyu Shan and Xinyu Wei and Zhenghao Xing and Hongsheng Li and Pheng-Ann Heng},
journal= {arXiv preprint arXiv:2505.17017},
year = {2025}
}
备注
Code is released at https://github.com/ZiyuGuo99/Image-Generation-CoT