中文

BPCLIP:基于CLIP的从失真到语义的自下而上图像质量评估

计算机视觉与模式识别 2025-06-24 v1

摘要

图像质量评估(IQA)旨在基于人类主观感知来评估图像的感知质量。现有方法通常组合多尺度特征以实现高性能,但大多数方法依赖于这些特征的直接线性融合,这可能不足以充分捕捉失真对语义内容影响。为此,我们提出一种基于对比语言-图像预训练(CLIP,一种最近提出的模型,用于在共享特征空间中对齐图像和文本)的自下而上图像质量评估方法,称为BPCLIP,该方法逐步提取低层失真对高层语义的影响。具体而言,我们利用编码器从输入图像中提取多尺度特征,并引入自下而上多尺度交叉注意力模块以捕捉浅层和深层特征之间的关系。此外,通过纳入6个不同维度上40个图像质量形容词,我们使预训练的CLIP文本编码器能够生成图像固有质量的表示,从而加强了图像质量感知与人类语言之间的联系。我们的方法在大多数公共全参考(FR)和无参考(NR)IQA基准测试中均取得优异成绩,并表现出更好的鲁棒性。

关键词

引用

@article{arxiv.2506.17969,
  title  = {BPCLIP: A Bottom-up Image Quality Assessment from Distortion to Semantics Based on CLIP},
  author = {Chenyue Song and Chen Hui and Wei Zhang and Haiqi Zhu and Shaohui Liu and Hong Huang and Feng Jiang},
  journal= {arXiv preprint arXiv:2506.17969},
  year   = {2025}
}

备注

Accepted to ICME 2025