用于单正样本多标签学习的视觉-语言伪标签方法
计算机视觉与模式识别
2023-10-25 v1
摘要
本文提出一种用于单正样本多标签学习的新方法。在一般多标签学习中,模型学习为单张输入图像预测多个标签或类别。这与标准多类图像分类不同,后者任务是从多个可能标签中为图像预测单个标签。单正样本多标签学习(SPML)特指在训练数据中每幅图像仅有一个标注的情况下,学习预测多个标签。多标签学习在许多方面比单标签学习更贴近现实任务,因为真实世界数据常同时涉及属于多个类别的实例;然而,由于为每实例收集多个高质量标注固有的复杂性与成本,大多数常见计算机视觉数据集主要含单标签。我们提出一种称为视觉-语言伪标注(VLPL)的新方法,其使用视觉-语言模型来给出强正伪标签与负伪标签,并在 Pascal VOC 上超越当前 SOTA 方法 5.5%、在 MS-COCO 上 18.4%、在 NUS-WIDE 上 15.2%、在 CUB-Birds 上 8.4%。我们的代码与数据见 https://github.com/mvrl/VLPL。
引用
@article{arxiv.2310.15985,
title = {Vision-Language Pseudo-Labels for Single-Positive Multi-Label Learning},
author = {Xin Xing and Zhexiao Xiong and Abby Stylianou and Srikumar Sastry and Liyu Gong and Nathan Jacobs},
journal= {arXiv preprint arXiv:2310.15985},
year = {2023}
}