中文

面向 AI 生成人类图像的主观对齐数据集与评估指标

计算机视觉与模式识别 2025-05-01 v1

摘要

文本到图像 (T2I) 生成方法的快速发展吸引了大量关注,旨在评估生成图像的质量,催生了各种通用 T2I 输出的质量评估方法。然而,现有的图像质量评估 (IQA) 方法仅提供全局质量评分,无法为结构复杂的主体(如人类)提供细粒度的感知评估,这是一大挑战,因为 AI 生成的人类图像 (AGHI) 常常出现解剖和纹理失真。为此,我们引入 AGHI-QA,即首个专为 AGHI 质量评估设计的大规模基准数据集。数据集包含 4000 张由 400 个精心设计的文本提示生成的 10 种最先进 T2I 模型生成的图像。我们进行系统性主观研究,收集多维度标注,包括感知质量评分、文本-图像对应评分、可见和失真身体部位标签。基于 AGHI-QA,我们评估了当前 T2I 方法在生成人类图像方面的多维度优势与不足。此外,我们提出 AGHI-Assessor,一种新型质量指标,将大型多模态模型 (LMM) 与领域特定人类特征相结合,以实现对 AGHI 的精准质量预测和可见/失真身体部位的识别。大量实验结果表明,AGHI-Assessor 在多维度质量评估方面显著优于现有 IQA 方法,在识别 AGHI 的结构失真方面超越了领先的 LMM。

关键词

引用

@article{arxiv.2504.21308,
  title  = {AGHI-QA: A Subjective-Aligned Dataset and Metric for AI-Generated Human Images},
  author = {Yunhao Li and Sijing Wu and Wei Sun and Zhichao Zhang and Yucheng Zhu and Zicheng Zhang and Huiyu Duan and Xiongkuo Min and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2504.21308},
  year   = {2025}
}