基于分解评估的人类偏好对齐概念自定义基准
计算机视觉与模式识别
2025-09-04 v1
摘要
概念自定义的评估具有挑战性,因为它需要全面评估对生成提示和概念图像的忠实度。此外,评估多个概念的难度显著大于评估单个概念,因为这需要不仅针对每个单独概念进行详细评估,还要对概念之间的相互作用进行评估。虽然人类能够直观地评估生成图像,但现有的指标往往要么过于狭窄,要么过于泛化,导致与人类偏好不一致。为此,我们提出了分解 GPT 评分 (D-GPTScore),这是一种新型的人类对齐评估方法,将评估标准分解为更细细分方面,并通过多模态大语言模型 (MLLM) 融合方面级评估。此外,我们发布了人类偏好对齐概念自定义基准 (CC-AlignBench),包含单概念和多概念任务,使其能够在广泛的难度范围内进行阶段性评估——从单个动作到多人互动。我们的方法在该基准上显著优于现有方法,表现出更高的对人类偏好的相关性。这一工作确立了评估概念自定义的新标准,并为未来研究指出了关键挑战。该基准及相关材料可在 https://github.com/ReinaIshikawa/D-GPTScore 查阅。
关键词
引用
@article{arxiv.2509.03385,
title = {Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation},
author = {Reina Ishikawa and Ryo Fujii and Hideo Saito and Ryo Hachiuma},
journal= {arXiv preprint arXiv:2509.03385},
year = {2025}
}
备注
Accepted to ICCV Workshop 2025