中文

IE-Critic-R1: 推进面向人类感知对齐的文本驱动图像编辑的可解释性度量

计算机视觉与模式识别 2025-11-25 v1 人工智能 计算与语言

摘要

近年来文本驱动图像编辑取得了显著进展,然而准确评估这些编辑后图像的任务仍然构成巨大挑战。与文本驱动图像生成的评估不同,文本驱动图像编辑的特点是同时以文本和源图像为条件。编辑后的图像通常保留与原始图像的内在联系,并随文本语义动态变化。然而,先前的方法往往只关注文本-图像对齐,或者未能与人类感知良好对齐。在这项工作中,我们引入了文本驱动图像编辑基准套件(IE-Bench)以增强对文本驱动编辑后图像的评估。IE-Bench包含一个数据库,其中包含多样化的源图像、各种编辑提示以及来自不同编辑方法的相应编辑结果,以及近4000个样本及其对应的由15名受试者提供的平均意见得分。此外,我们引入了IE-Critic-R1,它受益于基于可验证奖励的强化学习,为文本驱动图像编辑提供了更全面、更具可解释性的、与人类感知对齐的质量评估。大量实验表明,与先前的度量标准相比,IE-Critic-R1在文本驱动图像编辑任务上具有优越的主观对齐性。相关数据和代码已公开。

关键词

引用

@article{arxiv.2511.18055,
  title  = {IE-Critic-R1: Advancing the Explanatory Measurement of Text-Driven Image Editing for Human Perception Alignment},
  author = {Bowen Qu and Shangkun Sun and Xiaoyu Liang and Wei Gao},
  journal= {arXiv preprint arXiv:2511.18055},
  year   = {2025}
}

备注

18 pages, 10 figures, 8 tables