面向视觉生成的统一个人化奖励模型
计算机视觉与模式识别
2026-02-11 v2
摘要
多模态奖励模型 (RM) 的最新进展显著推动了视觉生成的发展。现有框架通常采用Bradley-Terry 式偏好建模或利用生成式 VLMS 作为评判器,随后通过强化学习优化视觉生成模型。然而,当前 RM 存在固有局限性:它们往往遵循“一刀切”范式,假设单一偏好分布,或依赖固定评估规范,导致对内容相关的视觉线索不敏感,系统性地与主观且情境依赖的人类偏好错位。为此,灵感来源于人类评估,我们提出UnifiedReward-Flex,一种面向视觉生成的统一个人化奖励模型,将奖励建模与灵活且情境自适应的推理耦合。具体而言,给定提示和生成的视觉内容,首先解释语义意图并基于视觉证据进行 grounding,然后动态构建分层评估,通过实例化预定义和自生成的高层维度下的细粒度准则。我们的训练管道遵循两个阶段:(1) 我们首先从高级闭源 VLMS 提炼结构化高质量推理轨迹,以引导 SFT,赋予模型灵活且情境自适应的推理行为;(2) 然后对精心挑选的偏好对进行直接偏好优化 (DPO),进一步强化推理忠诚度和判别性对齐。为验证有效性,我们将UnifiedReward-Flex 集成到 GRPO 框架中进行图像和视频合成,广泛实验结果表明其优越性。
引用
@article{arxiv.2602.02380,
title = {Unified Personalized Reward Model for Vision Generation},
author = {Yibin Wang and Yuhang Zang and Feng Han and Jiazi Bu and Yujie Zhou and Cheng Jin and Jiaqi Wang},
journal= {arXiv preprint arXiv:2602.02380},
year = {2026}
}
备注
Website: https://codegoat24.github.io/UnifiedReward/flex