中文

少样本条件下检测一切目标

计算机视觉与模式识别 2024-10-04 v4

摘要

少样本目标检测旨在仅给定少量示例图像的情况下检测新颖类别。这是机器人在开放环境中执行任务的基本技能。近期方法聚焦于微调策略,其复杂流程阻碍了更广泛的应用。本文中,我们引入 DE-ViT,一种无需微调的少样本目标检测器。DE-ViT 的新颖架构基于一种用于定位的新区域传播机制。传播的区域掩码通过可学习的空间积分层转换为边界框。我们提出使用原型将 ViT 特征投影到一个对基类过拟合鲁棒的子空间,而非训练原型分类器。我们在 Pascal VOC、COCO 和 LVIS 的少样本及单样本目标检测基准上评估 DE-ViT。DE-ViT 在所有基准上确立了新的最先进结果。值得注意的是,在 COCO 上,DE-ViT 在 10-shot 上超越少样本 SoTA 15 mAP,在 30-shot 上超越 7.2 mAP,在单样本上超越 SoTA 2.8 AP50。在 LVIS 上,DE-ViT 超越少样本 SoTA 17 box APr。此外,我们通过构建基于示例图像对新物体进行排序的抓取放置系统,用真实机器人评估了 DE-ViT。我们的机器人演示视频、DE-ViT 的源代码与模型可在 https://mlzxy.github.io/devit 找到。

关键词

引用

@article{arxiv.2309.12969,
  title  = {Detect Everything with Few Examples},
  author = {Xinyu Zhang and Yuhan Liu and Yuting Wang and Abdeslam Boularias},
  journal= {arXiv preprint arXiv:2309.12969},
  year   = {2024}
}

备注

CoRL 2024