超越余弦相似性:基于幅值感知的CLIP用于无参考图像质量评估
计算机视觉与模式识别
2026-02-03 v3 人工智能
摘要
最近的研究将对比语言-图像预训练 (CLIP) 模型用于无参考图像质量评估 (NR-IQA),通过测量图像嵌入与诸如 "a good photo" 或 "a bad photo" 等文本提示之间的余弦相似度。然而,这种语义相似性忽略了一个关键且尚未充分探索的线索:CLIP 图像特征的幅值,我们经验上发现其与感知质量呈强相关性。在本工作中,我们引入一种新型自适应融合框架,将余弦相似性与幅值感知质量线索相结合。具体而言,我们首先提取 CLIP 图像特征的绝对值,并应用 Box-Cox 变换进行统计归一化,以减轻语义敏感性。 resulting scalar summary 作为语义归一化的辅助线索,补充余弦基于提示的匹配。为有效整合两个线索,我们进一步设计了置信感知融合方案,根据每个线索的相对强度自适应加权每个术语。大量实验表明,在多个基准 IQA 数据集上,我们的方法在不进行任务特定训练的情况下,始终优于基于标准 CLIP 的 IQA 方法和最先进的基线方法。
引用
@article{arxiv.2511.09948,
title = {Beyond Cosine Similarity: Magnitude-Aware CLIP for No-Reference Image Quality Assessment},
author = {Zhicheng Liao and Dongxu Wu and Zhenshan Shi and Sijie Mai and Hanwei Zhu and Lingyu Zhu and Yuncheng Jiang and Baoliang Chen},
journal= {arXiv preprint arXiv:2511.09948},
year = {2026}
}
备注
Accepted by AAAI 2026