中文

用于文本到图像扩散模型微调的简单且有效的强化学习方法

机器学习 2026-03-10 v7 人工智能 计算机视觉与模式识别

摘要

基于强化学习(RL)的微调方法日益成为与黑箱目标对齐扩散模型的强大方法。最近常用的策略优化方法是近端策略优化(PPO)。虽然 PPO 在性能和样本复杂度方面都很有效,但对超参数极其敏感,计算开销也很大。相比之下,REINFORCE 能缓解诸如高内存开销和敏感超参数调优等实现复杂度,但由于方差较大且样本效率不足,在实际应用中表现次佳,这正是本文所关注的主要效率问题。虽然可以通过对每个输入提示抽取多个动作并使用基线校正项来降低 REINFORCE 的方差,但仍存在样本效率不足的问题。为此,本文系统分析了 REINFORCE 与 PPO 之间样本效率与效果之间的权衡,提出了一种新的用于扩散微调的 RL 方法——leave-one-out PPO(LOOP)。LOOP 将来自 REINFORCE 的方差缩减技术(如对每个输入提示抽取多个动作和基线校正项)与 PPO 的鲁棒性和样本效率(通过裁剪和重要性抽样)相结合。我们的结果表明,LOOP 在实现 various black-box objectives 时有效提升了扩散模型的性能,并在样本效率和最终性能之间取得了更好的平衡。

关键词

引用

@article{arxiv.2503.00897,
  title  = {A Simple and Effective Reinforcement Learning Method for Text-to-Image Diffusion Fine-tuning},
  author = {Shashank Gupta and Chaitanya Ahuja and Tsung-Yu Lin and Sreya Dutta Roy and Harrie Oosterhuis and Maarten de Rijke and Satya Narayan Shukla},
  journal= {arXiv preprint arXiv:2503.00897},
  year   = {2026}
}

备注

Published at Transactions on Machine Learning Research (TMLR), 2026