中文

面向图像质量评估的多模态大语言模型全面研究

计算机视觉与模式识别 2024-07-12 v3

摘要

尽管多模态大语言模型(MLLMs)在视觉理解和推理方面取得了显著进展,但其作为强大、灵活、可解释且以文本为驱动的图像质量评估(IQA)模型的潜力仍未得到充分探索。本文对MLLMs用于IQA的 prompting 方法进行了全面且系统的研究。我们首先研究了九种MLLMs的 prompting 系统,这些系统是三种标准心理物理学测试程序(即单刺激、双刺激和多刺激方法)与三种自然语言处理中流行的 prompting 策略(即标准、情境和链式思考 prompting)的组合。随后,我们提出了一种困难样本选择程序,考虑样本多样性和不确定性,以进一步挑战具有各自最佳 prompting 系统的MLLMs。我们在几个图像质量属性(如结构失真、纹理失真、几何变换和颜色差异)的完全参考和无参考场景下,对三个开源和一个闭源MLLMs进行评估。实验结果表明,只有闭源的GPT-4V为人类感知的图像质量提供了合理的解释,但在细粒度质量变异的判别(如颜色差异)以及比较多个图像的视觉质量方面较弱,而这些都是人类可以轻松完成的任务。

关键词

引用

@article{arxiv.2403.10854,
  title  = {A Comprehensive Study of Multimodal Large Language Models for Image Quality Assessment},
  author = {Tianhe Wu and Kede Ma and Jie Liang and Yujiu Yang and Lei Zhang},
  journal= {arXiv preprint arXiv:2403.10854},
  year   = {2024}
}