中文

VEIL:从野外图像描述文本中甄别提取标签以用于弱监督目标检测

计算机视觉与模式识别 2024-03-12 v3

摘要

由于标签噪声对定位的负面影响,大规模视觉-语言数据集在目标检测中的应用受到限制。先前的方法已展示此类大规模数据集如何用于预训练,这能为定位提供初始信号,但若至少某些类别没有干净的边界框数据,则仍显不足。我们提出了一种对从噪声描述文本中提取的标签进行“甄别”的技术,并将其用于弱监督目标检测(WSOD),且无需任何边界框。我们分析并标注了我们的Caption Label Noise数据集中描述文本里标签噪声的类型,并训练了一个分类器来预测提取的标签是否真实存在于图像中。我们的分类器可跨数据集边界和跨类别泛化。我们在五个数据集上将分类器与九种基线方法进行比较,并证明在不进行标签甄别的情况下,它能使WSOD提升30%(在PASCAL VOC上评估时mAP从31.2提升至40.5)。数据集见:https://github.com/arushirai1/CLaNDataset。

关键词

引用

@article{arxiv.2303.09608,
  title  = {VEIL: Vetting Extracted Image Labels from In-the-Wild Captions for Weakly-Supervised Object Detection},
  author = {Arushi Rai and Adriana Kovashka},
  journal= {arXiv preprint arXiv:2303.09608},
  year   = {2024}
}

备注

18th Conference of the European Chapter of the Association for Computational Linguistics (EACL) 2024 camera-ready