中文

基于Wasserstein正则化的在线奖励加权流匹配细调

机器学习 2025-02-11 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

近期的强化学习 (RL) 进展在微调基于扩散的生成模型方面取得了巨大成功。然而,对连续流基生成模型进行细调以对齐任意用户定义的奖励函数仍具有挑战性,特别是由于过优化导致策略崩溃以及连续时间流中似然成本极高的限制。在本文中,我们提出一种易于使用且在理论上严谨的 RL 细调方法,称为基于Wasserstein-2 正则化的在线奖励加权条件流匹配 (ORW-CFM-W2)。我们的方法将 RL 集成到流匹配框架中,以用于任意奖励函数的模型细调,无需奖励梯度或过滤数据集。通过引入在线奖励加权机制,我们的方法引导模型优先考虑数据流形上高奖励区域。为防止策略崩溃并保持多样性,我们将 Wasserstein-2 (W2) 距离正则化纳入方法中,并在流匹配中推导出可计算的上界,有效平衡策略优化的探索与开发。我们提供理论分析,说明该方法的收敛性质及其诱导的数据分布,建立与具有 Kullback-Leibler (KL) 正则化的传统 RL 算法的联系,提供对底层机制和学习行为的更全面理解。在包括目标图像生成、图像压缩和文本-图像对齐等任务上的大量实验表明,我们方法有效,实现了最优策略收敛,同时允许在奖励最大化和多样性保持之间进行可控权衡。

关键词

引用

@article{arxiv.2502.06061,
  title  = {Online Reward-Weighted Fine-Tuning of Flow Matching with Wasserstein Regularization},
  author = {Jiajun Fan and Shuaike Shen and Chaoran Cheng and Yuxin Chen and Chumeng Liang and Ge Liu},
  journal= {arXiv preprint arXiv:2502.06061},
  year   = {2025}
}

备注

61 pages