MARBLE:面向扩散强化学习的多方面奖励平衡
计算机视觉与模式识别
2026-05-08 v1 机器学习
摘要
强化学习微调已成为将扩散模型与人类偏好对齐的主流方法。然而,评估图像本质上是一项多维度的任务,需要同时优化多个评估标准。现有处理多奖励的做法是为每个奖励训练一个专家模型,优化加权和奖励 ,或使用手工设计的阶段调度进行顺序微调。这些方法要么无法产生一个可在所有奖励上联合训练的统一模型,要么需要大量手动调参的顺序训练。我们发现失败源于使用朴素的加权和奖励聚合。该方法存在样本层面的不匹配,因为大多数 rollout 是专家样本,对某些奖励维度信息量很大但对其他维度无关;因此,加权和稀释了它们的监督。为了解决这个问题,我们提出了 MARBLE(Multi-Aspect Reward BaLancE),一个梯度空间优化框架,它为每个奖励维护独立的优势估计器,计算每个奖励的策略梯度,并通过求解二次规划问题将它们协调为单一更新方向,而无需手动调参的奖励权重。我们进一步提出了一种摊销公式,利用 DiffusionNFT 中所用损失的仿射结构,将每步成本从 K+1 次反向传播降低至接近单奖励基线成本,并结合对平衡系数的 EMA 平滑,以稳定更新免受瞬态单批次波动的影响。在带有五个奖励的 SD3.5 Medium 上,MARBLE 同时改进了所有五个奖励维度,将最差对齐奖励的梯度余弦值从加和下 80% 的小批次中为负转变为持续为正,并以基线训练 0.97X 的训练速度运行。
引用
@article{arxiv.2605.06507,
title = {MARBLE: Multi-Aspect Reward Balance for Diffusion RL},
author = {Canyu Zhao and Hao Chen and Yunze Tong and Yu Qiao and Jiacheng Li and Chunhua Shen},
journal= {arXiv preprint arXiv:2605.06507},
year = {2026}
}
备注
Homepage and code repo: https://aim-uofa.github.io/MARBLE