中文

不要在 CLIP 之前下判断:一种面向感知任务的统一方法

计算机视觉与模式识别 2025-03-18 v1

摘要

视觉感知任务旨在预测人类对图像的判断(例如,图像唤起的情感、图像质量评估)。与物体/场景识别等客观任务不同,感知任务依赖于人类的主观评估,使其数据标注变得困难。此类人类标注数据的稀缺导致数据集较小,进而泛化能力差。通常,针对每个感知任务设计的专用模型都针对其独特特征和自身的训练数据集进行了定制。我们提出了一个统一的架构框架,利用 CLIP 作为先验来解决多个不同的感知任务。我们的方法基于最近的认知发现,表明 CLIP 与人类判断具有良好的相关性。虽然 CLIP 被显式训练以对齐图像和文本,但它也隐式地学习了人类的倾向。我们将此归因于 CLIP 训练数据中包含了人类编写的图像描述,这些描述不仅包含客观的图像描述,也不可避免地包含了人类的情感和情绪。这使得 CLIP 成为感知任务的一个特别强大的先验。因此,我们认为对 CLIP 进行最小程度的适配即足以解决各种感知任务。我们简单的统一框架采用轻量级适配对 CLIP 进行针对每个任务的微调,而不需要任何任务特定的架构更改。我们在三个任务上评估了我们的方法: 图像记忆性预测, 无参考图像质量评估,以及 视觉情感分析。我们的模型在所有三个任务上均取得了 SOTA 结果,同时展现了跨不同数据集的更好泛化能力。

关键词

引用

@article{arxiv.2503.13260,
  title  = {Don't Judge Before You CLIP: A Unified Approach for Perceptual Tasks},
  author = {Amit Zalcher and Navve Wasserman and Roman Beliy and Oliver Heinimann and Michal Irani},
  journal= {arXiv preprint arXiv:2503.13260},
  year   = {2025}
}