大模态模型辅助的AI生成图像质量评估
计算机视觉与模式识别
2024-08-06 v2
摘要
传统的基于深度神经网络(DNN)的图像质量评估(IQA)模型利用卷积神经网络(CNN)或Transformer学习质量感知特征表示,在自然场景图像上取得了令人赞赏的性能。然而,当应用于AI生成图像(AGIs)时,这些基于DNN的IQA模型表现出不佳的性能。这种情况很大程度上是由于生成过程的不可控性导致某些AGIs中固有的语义不准确。因此,辨别语义内容的能力对于评估AGIs的质量变得至关重要。受限于有限的参数复杂度和训练数据,传统的基于DNN的IQA模型难以捕获复杂的细粒度语义特征,从而难以把握整幅图像语义内容的存在性与连贯性。为了解决当前IQA模型在语义内容感知方面的不足,我们引入了大模态模型辅助的AI生成图像质量评估(MA-AGIQA)模型,该模型利用语义感知的指导来感知语义信息,并通过精心设计的文本提示提取语义向量。此外,它采用混合专家结构,将语义信息与传统的基于DNN的IQA模型提取的质量感知特征动态整合。在两个AI生成内容数据集AIGCQA-20k和AGIQA-3k上进行的综合实验表明,MA-AGIQA达到了SOTA性能,并证明了其在评估AGIs质量方面具有卓越的泛化能力。代码可在 https://github.com/wangpuyi/MA-AGIQA 获取。
引用
@article{arxiv.2404.17762,
title = {Large Multi-modality Model Assisted AI-Generated Image Quality Assessment},
author = {Puyi Wang and Wei Sun and Zicheng Zhang and Jun Jia and Yanwei Jiang and Zhichao Zhang and Xiongkuo Min and Guangtao Zhai},
journal= {arXiv preprint arXiv:2404.17762},
year = {2024}
}
备注
ACM MM'24