基于竞技场的离线奖励:扩散模型的高效细粒度偏好优化
计算机视觉与模式识别
2026-05-08 v1
摘要
强化学习从人类反馈(RLHF)有效提升文本到图像(T2I)扩散模型的偏好对齐。为提高计算效率,避免显式奖励建模的直接偏好优化(DPO)受到广泛关注。然而,其依赖二元反馈仅能进行粗粒度建模,导致优化次优。本文提出ArenaPO,利用竞技场得分作为离线奖励,提供细粒度反馈,实现高效优化且无需奖励模型。这使ArenaPO既能获益于传统RLHF的丰富奖励,又兼具DPO的高效性。具体而言,我们首先构建一个模型竞技场,將每个模型的能力表示为高斯分布,通过遍历标注的两两偏好来推断这些能力。每个输出图像视为来自对应能力分布的样本。随后,针对图像配对,依据两个能力分布及观察到的两两偏好,基于截断正态分布进行隐变量推断,以估计绝对质量间隙,作为训练中的细粒度反馈。该方法无需奖励模型且可离线计算,不引入额外训练开销。我们在Pick-a-Pic v2与HPD v3数据集上进行ArenaPO训练,实验证明ArenaPO持续优于现有基线。
引用
@article{arxiv.2605.06070,
title = {Arena as Offline Reward: Efficient Fine-Grained Preference Optimization for Diffusion Models},
author = {Zhikai Li and Yue Zhao and Edward Zhongwei Zhang and Xuewen Liu and Jing Zhang and Qingyi Gu and Zhen Dong},
journal= {arXiv preprint arXiv:2605.06070},
year = {2026}
}