将得分作为动作:基于连续时间强化学习的扩散模型微调框架
机器学习
2024-09-16 v1 人工智能
摘要
人类反馈强化学习(RLHF)已被证明是将生成模型与人类意图对齐的有前景的方向,近期的研究也探索了其在扩散生成模型对齐中的应用。在本工作中,我们通过将利用从人类反馈中学习的奖励函数微调扩散模型的任务形式化为一个探索性连续时间随机控制问题,提供了严谨的理论处理。我们的核心思想在于将得分匹配函数视为控制/动作,并在此基础上从连续时间视角开发了一个统一框架,以运用强化学习(RL)算法来提升扩散模型的生成质量。我们还在由随机微分方程驱动的环境假设下,发展了用于策略优化和正则化的相应连续时间 RL 理论。文本到图像(T2I)生成的实验将在配套论文中报告。
引用
@article{arxiv.2409.08400,
title = {Scores as Actions: a framework of fine-tuning diffusion models by continuous-time reinforcement learning},
author = {Hanyang Zhao and Haoxian Chen and Ji Zhang and David D. Yao and Wenpin Tang},
journal= {arXiv preprint arXiv:2409.08400},
year = {2024}
}