中文

信任你的评判者:用于忠实图像编辑与生成的鲁棒奖励建模与强化学习

计算机视觉与模式识别 2026-03-13 v1

摘要

强化学习(RL)已成为增强图像编辑和文本到图像(T2I)生成的一种有前景的范式。然而,当前的奖励模型(在RL中充当评判者)常常出现幻觉并给出噪声分数,从根本上误导优化过程。在本文中,我们提出了FIRM(忠实图像奖励建模),一个综合框架,用于开发鲁棒的奖励模型,为忠实的图像生成和编辑提供准确可靠的指导。首先,我们设计了定制化的数据整理流程来构建高质量的评分数据集。具体来说,我们使用执行性和一致性来评估编辑,而生成则主要通过指令遵循来评估。利用这些流程,我们收集了FIRM-Edit-370K和FIRM-Gen-293K数据集,并训练了专门化的奖励模型(FIRM-Edit-8B和FIRM-Gen-8B),这些模型准确反映了上述标准。其次,我们引入了FIRM-Bench,一个专门为编辑和生成评判者设计的综合基准。评估表明,与现有指标相比,我们的模型与人类判断的一致性更高。此外,为了将这些评判者无缝集成到RL流程中,我们提出了一种新颖的“基础加奖励”策略,以平衡相互竞争的目标:用于编辑的一致性调制执行(CME)和用于生成的质量调制对齐(QMA)。在该框架的赋能下,我们得到的模型FIRM-Qwen-Edit和FIRM-SD3.5取得了显著的性能突破。综合实验表明,FIRM减轻了幻觉,为保真度和指令遵循设立了超越现有通用模型的新标准。我们的所有数据集、模型和代码已在 https://firm-reward.github.io 公开提供。

关键词

引用

@article{arxiv.2603.12247,
  title  = {Trust Your Critic: Robust Reward Modeling and Reinforcement Learning for Faithful Image Editing and Generation},
  author = {Xiangyu Zhao and Peiyuan Zhang and Junming Lin and Tianhao Liang and Yuchen Duan and Shengyuan Ding and Changyao Tian and Yuhang Zang and Junchi Yan and Xue Yang},
  journal= {arXiv preprint arXiv:2603.12247},
  year   = {2026}
}