少做,多得:扩散模型的强化学习微调是否需要每一步优化?
计算机视觉与模式识别
2026-05-18 v1
摘要
尽管扩散模型在图像生成方面表现出色,但其重建目标限制了与人类偏好的对齐。强化学习通过显式奖励实现了这种对齐。然而,大多数研究将强化学习应用于整个去噪轨迹,这使得计算成本高昂并削弱了偏好对齐,即做得更多但收效更少。我们观察到,强化学习微调的影响在不同去噪阶段差异显著。在早期阶段,图像结构不稳定且远离最终奖励信号。在此阶段应用强化学习会导致奖励延迟和动作-奖励不匹配,从而产生高方差和低效更新。相反,在后期阶段,奖励增益饱和,持续训练倾向于过拟合局部细节,加剧了奖励破解。为应对这些挑战,我们提出了AdaScope,一个增强型即插即用模块,旨在提升生成质量同时降低计算成本。具体来说,通过感知去噪过程中的结构演变和语义一致性,AdaScope自适应地识别强化学习的最佳干预时机,并在去噪收敛且奖励增益饱和时动态终止训练。因此,它实现了罕见的“双重效益”:在显著提升性能的同时降低了计算成本。我们为AdaScope的设计提供了理论基础。与最先进的方法相比,AdaScope在将计算成本降低59%的同时,性能提升了66%。
引用
@article{arxiv.2605.15855,
title = {Do Less, Achieve More: Do We Need Every-Step Optimization for RL Fine-tuning of Diffusion Models?},
author = {Renye Yan and Jikang Cheng and Shikun Sun and Yi Sun and You Wu and Wei Peng and Zongwei Wang and Ling Liang and Junliang Xing and Yimao Cai},
journal= {arXiv preprint arXiv:2605.15855},
year = {2026}
}