重思扩散模型强化学习设计空间:超越损失设计的似然估计重要性
机器学习
2026-05-20 v2 人工智能
摘要
强化学习已被广泛应用于视觉任务如文本到图像生成的扩散模型和流模型中. 然而,这些任务仍具有挑战性,因为扩散模型的似然不可计算,这构成了直接应用流行策略梯度方法的障碍. 现有方法主要专注于构建新的目标,基于已经高度工程化的 LLM 目标,使用 ad hoc 方法估计似然,而未对这种估计对整体算法性能的影响进行彻底调查. 本文通过分离三个因素: i) 策略梯度目标, ii) 似然估计器, iii) rollout 采样方案,对 RL 设计空间进行系统性分析. 我们表明,采用基于证据下界 (ELBO) 的模型似然估计器,仅从最终生成样本计算,是有效、高效且稳定 RL 优化的决定性因素,超过了具体策略梯度损失函数的影响. 我们在多个奖励基准测试中验证了我们的发现,使用 SD 3.5 Medium,并在所有任务中观察到一致的趋势. 我们的方法在 90 个 GPU 小时内将 GenEval 分数从 0.24 提升到 0.95,比 FlowGRPO 高效 ,比 SOTA 方法 DiffusionNFT 高效 ,且无需奖励作弊.
引用
@article{arxiv.2602.04663,
title = {Rethinking the Design Space of Reinforcement Learning for Diffusion Models: On the Importance of Likelihood Estimation Beyond Loss Design},
author = {Jaemoo Choi and Yuchen Zhu and Wei Guo and Petr Molodyk and Bo Yuan and Jinbin Bai and Yi Xin and Molei Tao and Yongxin Chen},
journal= {arXiv preprint arXiv:2602.04663},
year = {2026}
}
备注
23 pages, 11 figures