中文

PCPO:用于对齐图像生成模型的比例信用策略优化

计算机视觉与模式识别 2026-02-25 v3 人工智能 机器学习

摘要

尽管强化学习推动了文本到图像(T2I)模型的对齐,但最先进的策略梯度方法仍受训练不稳定性和高方差的困扰,阻碍了收敛速度并损害了图像质量。我们的分析指出了这种不稳定性的一个关键原因:不成比例的信用分配,即生成采样器的数学结构在时间步上产生波动且不成比例的反馈。为了解决这个问题,我们提出了比例信用策略优化(PCPO),这是一个通过稳定的目标重构和有原则的时间步重加权来强制比例信用分配的框架。这种修正稳定了训练过程,从而显著加速收敛并提升图像质量。质量的提升是缓解模型崩溃的直接结果,而模型崩溃是递归训练中常见的失败模式。PCPO 在所有方面都大幅优于现有的策略梯度基线,包括最先进的 DanceGRPO。代码可在 https://github.com/jaylee2000/pcpo/ 获取。

关键词

引用

@article{arxiv.2509.25774,
  title  = {PCPO: Proportionate Credit Policy Optimization for Aligning Image Generation Models},
  author = {Jeongjae Lee and Jong Chul Ye},
  journal= {arXiv preprint arXiv:2509.25774},
  year   = {2026}
}

备注

35 pages, 20 figures. ICLR 2026