中文

探索合成数据在少样本目标检测中的威力

计算机视觉与模式识别 2023-05-15 v2

摘要

少样本目标检测(FSOD)旨在仅给定少量训练实例的情况下,将目标检测器扩展至新类别。极少的训练样本限制了 FSOD 模型的性能。近期的文本到图像生成模型在生成高质量图像方面已显示出有前景的结果。这些合成图像对 FSOD 任务的适用程度仍未被充分探索。本工作广泛研究了由最先进的文本到图像生成器生成的合成图像如何有益于 FSOD 任务。我们关注两个视角:(1)如何使用合成数据进行 FSOD?(2)如何从大规模合成数据集中找到代表性样本?我们设计了一个基于复制粘贴的使用合成数据的流程。具体而言,对原始生成图像应用显著性目标检测,并基于显著性图使用最小外接框裁剪主要目标。之后,将裁剪出的目标随机粘贴到来自基础数据集的图像上。我们还研究了文本到图像生成器的输入文本以及所用合成图像数量的影响。为构建具有代表性的合成训练数据集,我们通过基于样本和基于聚类的方法最大化所选图像的多样性。然而,FSOD 中新类别的高假阳性(FP)率的严重问题无法通过合成数据解决。我们提出将零样本识别模型 CLIP 集成到 FSOD 流程中,通过为检测目标与预测类别文本之间的相似度分数定义阈值,可过滤 90% 的 FP。在 PASCAL VOC 和 MS COCO 上的大量实验验证了我们的方法的有效性,与少样本基线相比性能提升高达 21.9%。

关键词

引用

@article{arxiv.2303.13221,
  title  = {Explore the Power of Synthetic Data on Few-shot Object Detection},
  author = {Shaobo Lin and Kun Wang and Xingyu Zeng and Rui Zhao},
  journal= {arXiv preprint arXiv:2303.13221},
  year   = {2023}
}