中文

重新思考部分标注下多标签识别的提示策略

计算机视觉与模式识别 2024-09-16 v1 人工智能 计算与语言 机器学习 多媒体

摘要

像 CLIP 这样的视觉-语言模型(VLM)已通过利用提示学习适应带有部分标注的多标签识别(MLR),其中为每个类别学习正负提示,以将其嵌入与共享视觉-文本特征空间中类别的存在或缺失相关联。虽然这种方法依赖 VLM 先验提升了 MLR 性能,但我们假设学习负提示可能是次优的,因为用于训练 VLM 的数据集缺乏明确关注类别缺失的图像-文本对。为了分析正负提示学习对 MLR 的影响,我们引入了 PositiveCoOp 和 NegativeCoOp,其中在 VLM 指导下仅学习一种提示,而另一种则被在共享特征空间中直接学习且不依赖文本编码器的嵌入向量所取代。通过经验分析,我们观察到负提示会降低 MLR 性能,而仅学习正提示并结合学习到的负嵌入(PositiveCoOp)优于双提示学习方法。此外,我们量化了提示学习相对于简单的纯视觉特征基线所提供的性能优势,观察到当缺失标签的比例较低时,该基线表现出与双提示学习方法(DualCoOp)相当的强劲性能,同时仅需一半的训练计算量和少 16 倍的参数。

关键词

引用

@article{arxiv.2409.08381,
  title  = {Rethinking Prompting Strategies for Multi-Label Recognition with Partial Annotations},
  author = {Samyak Rawlekar and Shubhang Bhatnagar and Narendra Ahuja},
  journal= {arXiv preprint arXiv:2409.08381},
  year   = {2024}
}