中文

探索CLIP用于评估图像的观感与质感

计算机视觉与模式识别 2022-11-24 v2

摘要

度量视觉内容的感知是计算机视觉中一个长期存在的问题。许多数学模型已被开发用于评估图像的观感或质量。尽管此类工具在量化噪声和模糊程度等退化方面有效,但这种量化与人类语言耦合松散。当涉及关于视觉内容质感的更抽象感知时,现有方法只能依赖通过费力用户研究收集的标注数据显式训练的监督模型。本文中,我们超越传统范式,探索对比语言—图像预训练(CLIP)模型中封装的丰富视觉语言先验,以零样本方式评估图像的质量感知(观感)与抽象感知(质感)。特别地,我们讨论了有效的提示设计,并展示了一种有效的提示配对策略以利用该先验。我们还在受控数据集和图像质量评估(IQA)基准上提供了大量实验。结果表明,CLIP捕获了可很好泛化到不同感知评估的有意义先验。代码见 https://github.com/IceClear/CLIP-IQA。

关键词

引用

@article{arxiv.2207.12396,
  title  = {Exploring CLIP for Assessing the Look and Feel of Images},
  author = {Jianyi Wang and Kelvin C. K. Chan and Chen Change Loy},
  journal= {arXiv preprint arXiv:2207.12396},
  year   = {2022}
}

备注

Accepted by AAAI2023. Code: https://github.com/IceClear/CLIP-IQA