中文

基于多模态提示学习的盲图质量评估

计算机视觉与模式识别 2024-05-21 v2

摘要

图质量评估(IQA)模型从语义信息中受益显著,这使它们能够对不同类型的对象采取不同措施。当前,利用语义信息来增强 IQA 是重要的研究方向。传统方法受限于缺乏足够标注数据,采用 CLIP 图像-文本预训练模型作为基础以获得语义感知能力。然而,这些通用视觉语言(VL)模型的通用性往往使其在 IQA 特定任务上表现不佳。最近的研究尝试通过提示技术来解决这一不匹配,但这些解决方案存在局限。现有的基于提示的 VL 模型过于关注文本的增量语义信息,忽略了来自视觉数据分析的丰富见解。这种不平衡限制了其在 IQA 任务中的性能提升。本文介绍了一种创新的多模态提示方法用于 IQA。我们采用精心设计的提示,协同从视觉和语言数据中挖掘增量语义信息。具体而言,在视觉分支,我们引入多层提示结构以增强 VL 模型的适应性。在文本分支,我们部署双重提示方案,引导模型识别和区分场景类别与失真类型,从而细化模型的图像质量评估能力。我们的实验结果表明,该方法优于现有的盲图质量评估(BIQA)方法。值得注意的是,在 various 数据集上实现了竞争性能。该方法在 CSIQ 上实现了 0.961 的 Spearman 秩相关系数(超越 0.946),在 KADID 上实现了 0.941(超过 0.930),说明其在 diverse 环境中的鲁棒性和准确性。

关键词

引用

@article{arxiv.2404.14949,
  title  = {Multi-Modal Prompt Learning on Blind Image Quality Assessment},
  author = {Wensheng Pan and Timin Gao and Yan Zhang and Runze Hu and Xiawu Zheng and Enwei Zhang and Yuting Gao and Yutao Liu and Yunhang Shen and Ke Li and Shengchuan Zhang and Liujuan Cao and Rongrong Ji},
  journal= {arXiv preprint arXiv:2404.14949},
  year   = {2024}
}