自适应混合尺度特征融合网络用于盲人AI生成图像质量评估
计算机视觉与模式识别
2024-04-24 v1 图像与视频处理
摘要
随着文本到图像和图像到图像生成模型的不断成熟,AI生成图像(AGI)在广告、娱乐、教育、社交媒体等领域展现出巨大的应用潜力。尽管生成模型已取得显著进展,但为设计相关质量评估模型的努力仍很少。本文提出一种新颖的盲图像质量评估(IQA)网络,命名为AMFF-Net,用于AGI。AMFF-Net从三个维度评估AGI质量,即“视觉质量”、“真实性”和“一致性”。具体而言,受人类视觉系统特征启发,鉴于“视觉质量”和“真实性”具有局部和全局两个方面,AMFF-Net对图像进行放大和缩小处理,并将缩放后的图像和原始尺寸的图像作为输入,以获取多尺度特征。随后,采用自适应特征融合(AFF)模块以可学习的权重自适应融合多尺度特征。此外,考虑到图像与提示词之间的相关性,AMFF-Net比较文本编码器和图像编码器提取的语义特征,以评估文本到图像的对齐程度。我们在三个AGI质量评估数据库上进行大量实验,实验结果表明,AMFF-Net的性能优于九种最新的盲IQA方法。消融实验结果进一步证明了所提出的多尺度输入策略和AFF模块的有效性。
引用
@article{arxiv.2404.15163,
title = {Adaptive Mixed-Scale Feature Fusion Network for Blind AI-Generated Image Quality Assessment},
author = {Tianwei Zhou and Songbai Tan and Wei Zhou and Yu Luo and Yuan-Gen Wang and Guanghui Yue},
journal= {arXiv preprint arXiv:2404.15163},
year = {2024}
}
备注
IEEE Transactions on Broadcasting (TBC)