中文

EditScore:通过高保真奖励建模解锁图像编辑中的在线强化学习

计算机视觉与模式识别 2026-02-03 v3

摘要

指令导向图像编辑取得了显著进展,但当前模型仍面临复杂指令挑战,常需多次采样才能生成期望结果。强化学习(RL)提供了有前景的解决方案,但其在图像编辑中的应用受限于缺乏高保真、高效的奖励信号。本文提出一种综合方法以克服这一障碍,核心是开发领域专用的奖励模型。我们首先引入 EditReward-Bench,一个全面的基准,用于系统评估奖励模型在编辑质量方面的表现。基于该基准,我们开发 EditScore,一系列针对评估指令导向图像编辑质量的奖励模型(规模从7B到72B)。通过严谨的数据筛选与过滤,EditScore 有效匹配学习专属视觉语言模型的性能。此外,结合针对 EditScore 生成性质的有效自集成策略,我们最大变体甚至超越 GPT-5 在基准中的表现。我们随后演示,高保真奖励模型是解锁图像编辑在线 RL 的关键。我们的实验表明,尽管最大开源 VLMs 无法提供有效学习信号,EditScore 却实现了高效稳健的策略优化。将我们的框架应用于强大的基础模型 OmniGen2,最终模型显示出显著且持续的性能提升。总体而言,本工作提供了从基准测试到奖励建模再到 RL 训练在图像编辑中系统化的路径,表明高保真、领域专用奖励模型是解锁该领域 RL 完全潜力的关键。

关键词

引用

@article{arxiv.2509.23909,
  title  = {EditScore: Unlocking Online RL for Image Editing via High-Fidelity Reward Modeling},
  author = {Xin Luo and Jiahao Wang and Chenyuan Wu and Shitao Xiao and Xiyan Jiang and Defu Lian and Jiajun Zhang and Dong Liu and Zheng liu},
  journal= {arXiv preprint arXiv:2509.23909},
  year   = {2026}
}

备注

Accepted to ICLR 2026. Code, models, and benchmark: https://github.com/VectorSpaceLab/EditScore