中文

面向盲人 AI 生成图像质量评估的视觉-语言一致性引导的多模态提示学习

计算机视觉与模式识别 2024-06-25 v1 人工智能

摘要

最近,文本提示调谐在适配 CLIP 模型用于自然图像质量评估方面展现出鼎舞性能力。然而,这种单模态提示学习方法仅调谂 CLIP 模型的语言分支,对适配 AI 生成图像质量评估 (AGIQA) 不够,因为 AGI 与自然图像在视觉上存在差异。此外,AGI 与用户输入文本提示之间的一致性——这与 AGI 的感知质量相关——尚未被用于引导 AGIQA。本文提出一种视觉-语言一致性引导的多模态提示学习方法,用于盲人 AGIQA,称为 CLIP-AGIQA。具体而言,我们在 CLIP 模型的语言和视觉分支中分别引入可学习的文本和视觉提示。此外,我们设计了一个文本到图像对齐质量预测任务,其学习得到的视觉-语言一致性知识用于引导上述多模态提示的优化。在两个公开 AGIQA 数据集上的实验结果表明,所提方法优于状态-of-the-art 质量评估模型。源代码已公开于 https://github.com/JunFu1995/CLIP-AGIQA。

关键词

引用

@article{arxiv.2406.16641,
  title  = {Vision-Language Consistency Guided Multi-modal Prompt Learning for Blind AI Generated Image Quality Assessment},
  author = {Jun Fu and Wei Zhou and Qiuping Jiang and Hantao Liu and Guangtao Zhai},
  journal= {arXiv preprint arXiv:2406.16641},
  year   = {2024}
}

备注

Accepted by IEEE Signal Processing Letter