中文

将文本提示引入AI生成图像质量评估

计算机视觉与模式识别 2024-05-22 v2 多媒体

摘要

AI生成图像具有固有的多模态特性。与针对自然场景的传统图像质量评估 (IQA) 不同,AGI质量评估 (AGIQA) 需要考虑图像与其文本提示之间的对应关系。这种对应关系耦合在真实分数中,会使单模态 IQA 方法产生混淆。为了解决这个问题,我们引入了 IP-IQA (AGIs Quality Assessment via Image and Prompt),一种通过结合相应图像与提示的 AGIQA 多模态框架。具体而言,我们提出了一种名为 Image2Prompt 的新型增量预训练任务,以更好地理解 AGI 及其对应的文本提示。同时,还应用了一个高效且有效的图像-提示融合模块以及一个新型特殊 [QA] token。两者均为即插即用,有助于图像与其对应提示的协同。实验表明,我们的 IP-IQA 在 AGIQA-1k 和 AGIQA-3k 数据集上达到了 SOTA。代码将发布于 https://github.com/Coobiw/IP-IQA。

关键词

引用

@article{arxiv.2403.18714,
  title  = {Bringing Textual Prompt to AI-Generated Image Quality Assessment},
  author = {Bowen Qu and Haohui Li and Wei Gao},
  journal= {arXiv preprint arXiv:2403.18714},
  year   = {2024}
}

备注

6 pages, 3 figures, accepted by ICME2024