中文

HP-Edit:面向图像编辑的人类偏好后训练框架

计算机视觉与模式识别 2026-04-22 v1 人工智能

摘要

常见的图像编辑任务通常采用强大的生成式扩散模型作为现实世界内容编辑的主导范式。同时,尽管诸如 Diffusion-DPO 和 Flow-GRPO 等强化学习(RL)方法进一步提升了生成质量,但由于缺乏可扩展的人类偏好数据集以及适应多样化编辑需求的框架,将人类反馈强化学习(RLHF)高效地应用于基于扩散的编辑在很大程度上仍未被探索。为了填补这一空白,我们提出了 HP-Edit,一个用于人类偏好对齐编辑的后训练框架,并引入了 RealPref-50K,一个涵盖八项常见任务并平衡常见物体编辑的现实世界数据集。具体而言,HP-Edit 利用少量人类偏好评分数据和预训练视觉大语言模型(VLM)开发了 HP-Scorer——一个自动的、与人类偏好对齐的评估器。随后,我们使用 HP-Scorer 高效构建可扩展的偏好数据集,并将其作为后训练编辑模型的奖励函数。我们还引入了 RealPref-Bench,一个用于评估现实世界编辑性能的基准测试。大量实验表明,我们的方法显著增强了诸如 Qwen-Image-Edit-2509 等模型,使其输出更符合人类偏好。

关键词

引用

@article{arxiv.2604.19406,
  title  = {HP-Edit: A Human-Preference Post-Training Framework for Image Editing},
  author = {Fan Li and Chonghuinan Wang and Lina Lei and Yuping Qiu and Jiaqi Xu and Jiaxiu Jiang and Xinran Qin and Zhikai Chen and Fenglong Song and Zhixin Wang and Renjing Pei and Wangmeng Zuo},
  journal= {arXiv preprint arXiv:2604.19406},
  year   = {2026}
}

备注

Accepted by CVPR2026