EditHF-1M:规模化的人类偏好反馈图像编辑数据集
计算机视觉与模式识别
2026-03-17 v1 多媒体
摘要
最近的文本导向图像编辑 (TIE) 模型取得了显著进展,但许多编辑后的图像仍存在 artifacts、意外编辑或不美观内容等问题。虽然已提出一些基准和方法用于评估编辑后的图像,但缺乏可扩展的评估模型,限制了人类反馈奖励模型在图像编辑中的发展。为此,我们首先引入 \textbf{EditHF-1M},一个规模为百万级的图像编辑数据集,包含超过 2900 万人类偏好对和 14.8 万人类平均满意度评分,这些评分从三个维度(视觉质量、指令对齐和属性保持)进行评估。基于 EditHF-1M,我们提出了 \textbf{EditHF},一种基于多模态大语言模型 (MLLM) 的评估模型,用于从图像编辑中提供与人类偏好相匹配的反馈。最后,我们引入了 \textbf{EditHF-Reward},其利用 EditHF 作为奖励信号,通过强化学习优化文本导向图像编辑模型。大量实验表明,EditHF 在与人类偏好对齐方面表现优异,并在其他数据集上 demonstrate 出强大的泛化能力。此外,我们使用 EditHF-Reward 对 Qwen-Image-Edit 进行微调,取得显著性能提升,表明 EditHF 能够作为放大图像编辑的奖励模型。该数据集和代码将在我们的 GitHub 仓库发布:https://github.com/IntMeGroup/EditHF。
引用
@article{arxiv.2603.14916,
title = {EditHF-1M: A Million-Scale Rich Human Preference Feedback for Image Editing},
author = {Zitong Xu and Huiyu Duan and Zhongpeng Ji and Xinyun Zhang and Yutao Liu and Xiongkuo Min and Ke Gu and Jian Zhang and Shusong Xu and Jinwei Chen and Bo Li and Guangtao Zhai},
journal= {arXiv preprint arXiv:2603.14916},
year = {2026}
}