中文

基于文本-视觉语义约束的人工智能生成图像质量评估

计算机视觉与模式识别 2025-07-17 v3

摘要

随着人工智能生成图像(AGI)技术的快速发展,对其质量的准确评估已成为日益重要的需求。现有方法通常依赖诸如CLIP或BLIP等跨模态模型来评估文本-图像对齐和视觉质量。然而,这些方法应用于AGI时会遇到两个主要挑战:语义错位和细节感知缺失。为解决这些限制,我们提出了基于文本-视觉语义约束的人工智能生成图像质量评估框架(SC-AGIQA),该框架利用文本-视觉语义约束显著增强对AGI图像文本-图像一致性和感知失真的综合评估。我们的方法整合了来自多个模型的关键能力,通过引入两个核心模块来解决上述挑战:文本辅助语义对齐模块(TSAM),该模块利用多模态大语言模型(MLLM)生成图像描述并将其与原始提示进行比较,以实现更精细的一致性检查;频域细粒度损坏感知模块(FFDPM),该模块借鉴人类视觉系统(HVS)的特性,采用频域分析结合感知灵敏度加权,以更好地量化细微视觉失真并增强对图像细粒度视觉质量细节的捕捉。在多个基准数据集上进行的大量实验表明,SC-AGIQA超过了现有最先进方法。代码已公开available at https://github.com/mozhu1/SC-AGIQA。

关键词

引用

@article{arxiv.2507.10432,
  title  = {Text-Visual Semantic Constrained AI-Generated Image Quality Assessment},
  author = {Qiang Li and Qingsen Yan and Haojian Huang and Peng Wu and Haokui Zhang and Yanning Zhang},
  journal= {arXiv preprint arXiv:2507.10432},
  year   = {2025}
}

备注

9 pages, 5 figures, Accepted at ACMMM 2025