中文

通过适配视觉-语言模型进行少样本图像质量评估

计算机视觉与模式识别 2025-09-23 v2

摘要

由于复杂的失真、多样的图像内容和有限的数据可用性,图像质量评估(IQA)仍然是计算机视觉中一项未解决的挑战。现有的无参考 IQA(BIQA)方法在很大程度上依赖大量的人工标注,由于创建 IQA 数据集的苛刻性质,这既费时又昂贵。为了减少这种依赖,我们提出了梯度调节元提示 IQA 框架(GRMP-IQA),旨在将视觉-语言预训练模型 CLIP 高效适配到 IQA 任务中,即使在数据有限的情况下也能实现高精度。GRMP-IQA 由两个核心模块组成: 元提示预训练模块和 质量感知梯度正则化。元提示预训练模块利用元学习范式,在不同失真间预训练具有共享元知识的软提示,从而实现对各种 IQA 任务的快速适配。另一方面,质量感知梯度正则化旨在微调期间调整更新梯度,将模型的注意力集中在与质量相关的特征上,并防止对语义信息的过拟合。在标准 BIQA 数据集上的大量实验表明,在有限数据设置下,其性能优于 SOTA BIQA 方法。值得注意的是,仅使用 20% 的训练数据,GRMP-IQA 即可与大多数现有的全监督 BIQA 方法相媲美。

关键词

引用

@article{arxiv.2409.05381,
  title  = {Few-Shot Image Quality Assessment via Adaptation of Vision-Language Models},
  author = {Xudong Li and Zihao Huang and Yan Zhang and Yunhang Shen and Ke Li and Xiawu Zheng and Liujuan Cao and Rongrong Ji},
  journal= {arXiv preprint arXiv:2409.05381},
  year   = {2025}
}