在图像编辑中利用基于验证器的强化学习
计算机视觉与模式识别
2026-05-21 v2
摘要
虽然基于人类反馈的强化学习(RLHF)已成为文本到图像生成的关键范式,但其在图像编辑中的应用仍基本未被探索。一个关键瓶颈是缺乏适用于所有编辑任务的鲁棒通用奖励模型。现有的编辑奖励模型通常只给出整体评分,缺乏详细检查,忽略了不同的指令要求,并导致有偏的奖励。为解决此问题,我们认为关键在于从简单的评分器转向推理验证器。我们引入了 Edit-R1,一个构建基于思维链(CoT)验证器的推理奖励模型(RRM)并利用其进行下游图像编辑的框架。Edit-RRM 将指令分解为不同的原则,根据每个原则评估编辑后的图像,并将这些检查聚合为一个可解释的、细粒度的奖励。为构建这样的 RRM,我们首先应用监督微调(SFT)作为“冷启动”来生成 CoT 奖励轨迹。然后,我们引入分组对比偏好优化(GCPO),这是一种利用人类成对偏好数据来强化我们逐点 RRM 的强化学习算法。在构建 RRM 之后,我们使用 GRPO 来训练编辑模型,该模型使用这个不可微但强大的奖励模型。大量实验表明,我们的 Edit-RRM 作为编辑特定的奖励模型,超越了 Seed-1.5-VL 和 Seed-1.6-VL 等强大的视觉语言模型(VLM),并且我们观察到了明显的缩放趋势,性能从 3B 到 7B 参数持续提升。此外,Edit-R1 为 FLUX.1-kontext 等编辑模型带来了增益,突显了其在增强图像编辑方面的有效性。
引用
@article{arxiv.2604.27505,
title = {Leveraging Verifier-Based Reinforcement Learning in Image Editing},
author = {Hanzhong Guo and Jie Wu and Jie Liu and Yu Gao and Zilyu Ye and Linxiao Yuan and Xionghui Wang and Yizhou Yu and Weilin Huang},
journal= {arXiv preprint arXiv:2604.27505},
year = {2026}
}