Edit-Compass 与 EditReward-Compass:面向图像编辑与奖励建模的统一基准
计算机视觉与模式识别
2026-05-14 v1
摘要
近期图像编辑模型在指令遵循、多模态理解和复杂视觉编辑方面取得了显著进展。然而,现有基准常常因任务难度有限和粗糙的评估协议,难以忠实反映人类判断,尤其是针对强大的前沿模型。此外,奖励模型在 RL 基于图像编辑的优化中日益重要,但现有的奖励模型基准仍依赖不切实际的评估设置,偏离实际的 RL 场景。这些限制阻碍了对图像编辑模型和奖励模型进行可靠评估。为此,我们引入 Edit-Compass 与 EditReward-Compass,一个用于图像编辑和奖励建模的统一评估套件。Edit-Compass 包含 2,388 个经过精心标注的实例,涵盖六个逐步提升的任务类别,涵盖世界知识推理、视觉推理和多图像编辑等能力。除广泛的任务覆盖外,Edit-Compass 采用基于结构推理和精心设计的评分标准的细粒度多维评估框架。此外,EditReward-Compass 包含 2,251 对偏好对,模拟 RL 优化期间的真实奖励建模场景。
引用
@article{arxiv.2605.13062,
title = {Edit-Compass & EditReward-Compass: A Unified Benchmark for Image Editing and Reward Modeling},
author = {Xuehai Bai and Yang Shi and Yi-Fan Zhang and Xuanyu Zhu and Yuran Wang and Yifan Dai and Xinyu Liu and Yiyan Ji and Xiaoling Gu and Yuanxing Zhang},
journal= {arXiv preprint arXiv:2605.13062},
year = {2026}
}