面向文本引导图像编辑的可扩展人类对齐基准
计算机视觉与模式识别
2025-05-02 v1
摘要
最近已经提出了多种文本引导的图像编辑模型。然而,由于该任务的主观性质,目前没有广泛接受的标准化评估方法,使得研究人员依赖于人工用户研究。为了解决这个问题,我们引入了一种用于文本引导图像编辑的新型人类对齐基准。HATIE 提供了一个涵盖广泛编辑任务的大规模基准测试集,允许进行可靠的评估,且不局限于特定的易于评估的案例。同时,HATIE 提供了一个全自动且全方位的评估流水线。具体而言,我们结合了衡量编辑各个方面的多个分数,以与人类感知保持一致。我们通过经验验证了 HATIE 的评估在各个方面确实与人类对齐,并提供了几个 SOTA 模型的基准测试结果,以对其性能提供更深入的见解。
引用
@article{arxiv.2505.00502,
title = {Towards Scalable Human-aligned Benchmark for Text-guided Image Editing},
author = {Suho Ryu and Kihyun Kim and Eugene Baek and Dongsoo Shin and Joonseok Lee},
journal= {arXiv preprint arXiv:2505.00502},
year = {2025}
}
备注
Accepted to CVPR 2025 (highlight)