中文

Q-REAL:面向 AI 生成内容的逼真度与合理性评估

计算机视觉与模式识别 2026-04-02 v2

摘要

AI 生成内容的质量评估对于评估模型能力和指导模型优化至关重要。然而,大多数现有质量评估数据集和模型仅提供单一质量评分,这过于粗糙,无法为改进生成模型提供针对性指导。在当前 AI 生成图像应用中,逼真度和合理性是两个关键维度,随着统一生成-理解模型的出现,通过这两个维度进行细粒度评估尤其有效,可用于提升生成性能。因此,我们引入 Q-Real,这是一个用于细粒度评估 AI 生成图像逼真度和合理性的新型数据集。Q-Real 包含 3088 张由流行文本到图像模型生成的图像。对于每张图像,我们标注主要实体的位置,并提供一套针对这些实体在逼真度和合理性两个维度上的判断问题和归因描述。鉴于最近多模态大语言模型(MLLM)的进展使 AI 生成图像的细粒度评估成为可能,我们构建 Q-Real Bench 来评估它们在两个任务上的表现:判断任务和带推理的定位任务。最后,为了提升 MLLM 的能力,我们设计了一个微调框架,并在多个 MLLM 上使用该数据集进行实验。实验结果表明,我们的数据集质量高且意义重大,基准测试全面且有效。数据集和代码将在出版后公开。

关键词

引用

@article{arxiv.2511.16908,
  title  = {Q-REAL: Towards Realism and Plausibility Evaluation for AI-Generated Content},
  author = {Shushi Wang and Zicheng Zhang and Chunyi Li and Wei Wang and Liya Ma and Fengjiao Chen and Xiaoyu Li and Xuezhi Cao and Guangtao Zhai and Xiaohong Liu},
  journal= {arXiv preprint arXiv:2511.16908},
  year   = {2026}
}