中文

ROCM:一致性模型上的 RLHF

机器学习 2025-03-11 v1 人工智能

摘要

扩散模型彻底改变了图像、音频和视频合成等连续域中的生成式建模。然而,其迭代采样过程导致生成缓慢和训练低效,当引入基于人类反馈的强化学习 (RLHF) 时,由于稀疏奖励和长时间跨度,这些挑战进一步加剧。一致性模型通过实现单步或高效多步生成来解决这些问题,显著降低了计算成本。在这项工作中,我们提出了一个将 RLHF 应用于一致性模型的直接奖励优化框架,引入分布式正则化以增强训练稳定性并防止奖励黑客行为。我们研究了各种 ff-divergence 作为正则化策略,在奖励最大化和模型一致性之间取得平衡。与策略梯度方法不同,我们的方法利用一阶梯度,使其更高效且对超参数调优不那么敏感。实证结果表明,与基于策略梯度的 RLHF 方法相比,我们的方法在各种自动指标和人类评估中均取得了具有竞争力或更优的性能。此外,我们的分析展示了不同正则化技术在提高模型泛化能力和防止过拟合方面的影响。

关键词

引用

@article{arxiv.2503.06171,
  title  = {ROCM: RLHF on consistency models},
  author = {Shivanshu Shekhar and Tong Zhang},
  journal= {arXiv preprint arXiv:2503.06171},
  year   = {2025}
}