中文

M3-AGIQA:多模态、多轮、多维度 AI 生成图像质量评估

计算机视觉与模式识别 2025-06-05 v2

摘要

AI 生成图像(AIGI)模型的快速发展为评估图像质量带来了新挑战,尤其是涉及感知质量、提示对应性和真实性三个方面。为此,我们提出了 M3-AGIQA,一个综合性框架,利用多模态大语言模型(MLLM)实现对 AI 生成图像在视觉与文本领域的更符合人类直觉的整体评估。此外,我们的框架具备结构化的多轮评估流程,通过生成和分析中间图像描述,为深入洞察这三个方面提供了更深入的见解。通过使模型输出更贴近人类判断,M3-AGIQA 能提供稳健且可解释的质量评分。大量实验表明,在多个基准数据集上,本方法在所测试的数据集和维度上实现了最新性能,并在大多数跨数据集设置中表现出强大的泛化能力。代码已公开于 https://github.com/strawhatboy/M3-AGIQA。

关键词

引用

@article{arxiv.2502.15167,
  title  = {M3-AGIQA: Multimodal, Multi-Round, Multi-Aspect AI-Generated Image Quality Assessment},
  author = {Chuan Cui and Kejiang Chen and Zhihua Wei and Wen Shen and Weiming Zhang and Nenghai Yu},
  journal= {arXiv preprint arXiv:2502.15167},
  year   = {2025}
}

备注

24 pages. This work has been submitted to the ACM for possible publication