中文

ReasonEdit:面向可解释图像编辑评估的强化学习方法

计算机视觉与模式识别 2026-05-11 v1

摘要

最新的文本导向图像编辑(TIE)模型取得了显著进展,但许多编辑结果仍存在伪影、意外修改和次优美学问题。尽管提出了多个基准测试和评估方法,但大多数现有方法依赖标量评分,缺乏可解释性。这一局限性主要源于缺乏针对TIE的高质量解释数据集以及有效的奖励模型用于训练可解释评估器。为解决这些挑战,我们引入了ReasonEdit-22K,这是第一个将22K张编辑后图像与113K个思维链(Chain-of-Thought, CoT)样本相结合的 数据集,还包含130万人类判断,用于评估这些解释在逻辑性、准确性和实用性方面的表现。基于该数据集,我们提出了RE-Reward,一种基于多模态大语言模型(MLLM)的奖励模型,旨�提供针对图像编辑中可解释推理的评估反馈。此外,我们开发了ReasonEdit,该模型通过来自RE-Reward的奖励信号和Group Relative Policy Optimization(GRPO)算法进行训练,以学习可解释的评估模型。大量实验表明,ReasonEdit在与人类偏好一致性方面取得优异性能,并在多个公开基准测试中展现出强大的泛化能力。它能够生成高质量的可解释评估文本,使图像编辑的评估更加透明可信。代码已公开于https://github.com/IntMeGroup/ReasonEdit。

关键词

引用

@article{arxiv.2605.07477,
  title  = {ReasonEdit: Towards Interpretable Image Editing Evaluation via Reinforcement Learning},
  author = {Honghua Chen and Zitong Xu and Huiyu Duan and Xinyun Zhang and Xiongkuo Min and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2605.07477},
  year   = {2026}
}