开放词汇 vs. 封闭集:考虑文本可描述性的少样本目标检测最佳实践
计算机视觉与模式识别
2024-10-22 v1
摘要
开放词汇目标检测(OVD)利用仅有的语言描述(例如类别名称)来检测特定类别的物体,无需任何图像样本,已引起广泛关注。然而,在实际应用中,目标类别概念通常难以用文本描述,指定目标对象的唯一方法是提供其图像示例,但获取足够数量的样本往往具有挑战性。因此,实践者对少样本目标检测(FSOD)有很高的需求。一个自然的问题出现了:对于难以用文本描述的目标类别,OVD的优势能否扩展到FSOD?与仅学习预定义类别的传统方法(本文中称为封闭集目标检测,COD)相比,OVD的额外成本是否合理?为回答这些问题,我们提出了一种方法,利用CLIP的零样本图像分类精度来量化目标检测数据集的“文本可描述性”。这使我们能够将各种具有不同文本可描述性的OD数据集进行分类,并在每个类别内实证评估OVD和COD方法的FSOD性能。我们的发现表明:i) 在OD预训练条件相同的情况下,对于文本可描述性低的目标类别,OVD和COD之间几乎没有差异;ii) 尽管OVD可以从比OD特定数据更多样化的数据中学习,从而增加训练数据量,但对于文本可描述性低的类别,这可能适得其反。这些发现为实践者在OVD方法的最新进展中提供了宝贵的指导。
引用
@article{arxiv.2410.15315,
title = {Open-vocabulary vs. Closed-set: Best Practice for Few-shot Object Detection Considering Text Describability},
author = {Yusuke Hosoya and Masanori Suganuma and Takayuki Okatani},
journal= {arXiv preprint arXiv:2410.15315},
year = {2024}
}
备注
20 pages, 3 figures