中文

CLIP-Decoder:基于多模态 CLIP 对齐表示的零样本多标签分类

计算机视觉与模式识别 2024-06-24 v1

摘要

多标签分类是广泛应用于实际应用中的重要任务。多标签零样本学习是一种用于将图像分类到多个未见类别的方法,而在一般零样本情况下,测试集可能包含已观察到的类别。CLIP-Decoder 基于最先进的 ML-Decoder 注意力机制头提出了一种新方法。我们引入了 CLIP-Decoder 中的多模态表示学习,利用文本编码器提取文本特征并使用图像编码器进行图像特征提取。此外,我们通过对齐图像和词嵌入的维度并比较其各自的表示来最小化语义不匹配,采用由分类损失和 CLIP 损失组成的组合损失。该策略在其他方法之上,并在基于 CLIP-Decoder 的零样本多标签分类任务中实现了最先进的成绩。我们的方法在零样本多标签分类任务中比现有方法提高了 3.9%。在广义零样本学习多标签分类任务中,该方法几乎提高了 2.3%。

关键词

引用

@article{arxiv.2406.14830,
  title  = {CLIP-Decoder : ZeroShot Multilabel Classification using Multimodal CLIP Aligned Representation},
  author = {Muhammad Ali and Salman Khan},
  journal= {arXiv preprint arXiv:2406.14830},
  year   = {2024}
}

备注

Accepted at ICCVW- VLAR