中文

CDUL:基于 CLIP 驱动的无监督多标签图像分类学习

计算机视觉与模式识别 2024-03-08 v2

摘要

本文提出一种基于 CLIP 的无监督学习方法,用于无标注的多标签图像分类,包含初始化、训练和推理三个阶段。在初始化阶段,我们充分利用强大的 CLIP 模型,提出一种基于全局-局部图像-文本相似度聚合将 CLIP 扩展至多标签预测的新方法。具体而言,我们将每张图像分割为若干片段,并利用 CLIP 生成整图(全局)及每个片段(局部)的相似度向量。随后引入相似度聚合器以融合全局与局部相似度向量。在训练阶段,将聚合后的相似度得分作为初始伪标签,我们提出一种优化框架来训练分类网络参数并为未观测标签精炼伪标签。推理时仅使用分类网络预测输入图像的标签。大量实验表明,我们的方法在 MS-COCO、PASCAL VOC 2007、PASCAL VOC 2012 和 NUS 数据集上优于最先进的无监督方法,甚至取得了与弱监督分类方法相当的结果。

关键词

引用

@article{arxiv.2307.16634,
  title  = {CDUL: CLIP-Driven Unsupervised Learning for Multi-Label Image Classification},
  author = {Rabab Abdelfattah and Qing Guo and Xiaoguang Li and Xiaofeng Wang and Song Wang},
  journal= {arXiv preprint arXiv:2307.16634},
  year   = {2024}
}

备注

Accepted in ICCV2023