中文

FS-DETR:基于提示且无需重训练的少样本检测 Transformer

计算机视觉与模式识别 2023-08-22 v2 人工智能

摘要

本文研究少样本目标检测(FSOD),即在给定描绘新类别(训练时未见)的少量模板(示例)的情况下,目标是在一组图像中检测该类别的所有出现。从实际角度看,FSOD 系统必须满足以下期望特性:(a) 必须按原样使用,无需在测试时微调;(b) 必须能并发处理任意数量的新物体,同时支持每个类别任意数量的示例;(c) 必须达到与封闭系统相当的精度。为满足 (a)-(c),本工作做出如下贡献:我们首次提出一个简单而强大的、基于视觉提示的少样本检测 Transformer(FS-DETR),可同时满足期望特性 (a) 和 (b)。我们的系统构建于 DETR 框架之上,基于两个关键思想扩展:(1) 在测试时将所给新类别的视觉模板作为视觉提示输入;(2) 用伪类别嵌入(类似于软提示)“标记”这些提示,随后在解码器输出处被预测。重要的是,我们表明我们的系统不仅比现有方法更灵活,而且向满足期望特性 (c) 迈进了一步。具体而言,它比所有无需微调的方法显著更精确,甚至在最成熟的基准(PASCAL VOC 和 MSCOCO)上匹配并超越当前最先进的基于微调的方法。

关键词

引用

@article{arxiv.2210.04845,
  title  = {FS-DETR: Few-Shot DEtection TRansformer with prompting and without re-training},
  author = {Adrian Bulat and Ricardo Guerrero and Brais Martinez and Georgios Tzimiropoulos},
  journal= {arXiv preprint arXiv:2210.04845},
  year   = {2023}
}

备注

Accepted at ICCV 2023