通过软Q函数重参数化策略梯度的扩散模型微调
机器学习
2026-03-09 v3 人工智能
摘要
扩散模型擅长生成高似然样本,但通常需要与下游目标对齐。现有的扩散模型微调方法严重受到奖励过优化的影响,导致高奖励但不自然的样本和多样性退化。为缓解过优化,我们提出了基于软Q函数的扩散微调(SQDF),一种用于扩散对齐的新型KL正则化强化学习方法,该方法应用软Q函数训练免费、可微分估计的重参数化策略梯度。SQDF通过三项创新得到进一步增强:去噪过程中的折扣因子以实现适当的信用分配、一致性模型的集成以细化Q函数估计,以及离策略回放缓冲区的使用以改善模式覆盖和管理奖励-多样性权衡。我们的实验表明,SQDF在保持多样性的同时实现了优越的目标奖励。此外,在在线黑箱优化中,SQDF在保持自然性和多样性的同时达到了高样本效率。我们的代码可在 https://github.com/Shin-woocheol/SQDF 获取。
引用
@article{arxiv.2512.04559,
title = {Diffusion Fine-Tuning via Reparameterized Policy Gradient of the Soft Q-Function},
author = {Hyeongyu Kang and Jaewoo Lee and Woocheol Shin and Kiyoung Om and Jinkyoo Park},
journal= {arXiv preprint arXiv:2512.04559},
year = {2026}
}
备注
ICLR 2026