中文

CLIP 为视觉美学学习器带来更优特征

计算机视觉与模式识别 2025-08-05 v2 多媒体

摘要

图像美学评估(IAA)因其主观性和昂贵的人工标注而是一项具有挑战性的任务。近期的大规模视觉-语言模型,如对比语言-图像预训练(CLIP),已展现出对各种下游任务颇具前景的表征能力。然而,CLIP 在资源受限和低数据量的 IAA 任务中的应用仍然有限。虽然少数将 CLIP 用于 IAA 的尝试主要集中于精心设计的提示,我们则超越此限制,允许来自不同领域且模型规模不同的模型从 CLIP 中获取知识。为此,我们提出一种统一且灵活的基于 CLIP 的两阶段半监督知识蒸馏(CSKD)范式,旨在学习轻量级 IAA 模型的同时利用 CLIP 的强泛化能力。具体而言,CSKD 采用特征对齐策略来促进异构 CLIP 教师模型与 IAA 学生模型之间的蒸馏,将预训练视觉表征中的有价值特征分别迁移至两个轻量级 IAA 模型。为在低数据场景下高效适配下游 IAA 任务,这两个强视觉美学学习器随后利用无标注样本进行蒸馏,以协作方式精炼并迁移任务特定知识。大量实验表明,所提出的 CSKD 在多个广泛使用的 IAA 基准上取得了最先进(SOTA)性能。此外,对特征对齐前后注意力距离与熵的分析显示了 CLIP 特征表征向 IAA 模型的有效迁移,这不仅为 IAA 的模型初始化提供了有价值的指导,也增强了 IAA 模型的美学特征表征。代码将公开可用。

关键词

引用

@article{arxiv.2307.15640,
  title  = {CLIP Brings Better Features to Visual Aesthetics Learners},
  author = {Liwu Xu and Jinjin Xu and Yuzhe Yang and Xilu Wang and Yijie Huang and Yaqian Li},
  journal= {arXiv preprint arXiv:2307.15640},
  year   = {2025}
}

备注

ICME 2025 Oral