中文

少样本视频目标检测

计算机视觉与模式识别 2022-08-09 v3

摘要

我们提出少样本视频目标检测(FSVOD),针对我们高度多样且动态的真实世界中的视觉学习挑战做出三项贡献:1)一个大规模视频数据集 FSVOD-500,包含 500 个类别,每类中有类别均衡的视频用于少样本学习;2)一种新颖的管提议网络(TPN),为目标视频对象(可能高度动态)生成高质量视频管提议以聚合特征表示;3)一种策略性改进的时间匹配网络(TMN+),用于匹配具有更好判别力的代表性查询管特征,从而实现更高多样性。我们的 TPN 与 TMN+ 联合并端到端训练。大量实验表明,与基于图像的方法及其他朴素的基于视频的扩展相比,我们的方法在两个少样本视频目标检测数据集上产生了显著更好的检测结果。代码与数据集发布于 \url{https://github.com/fanq15/FewX}。

关键词

引用

@article{arxiv.2104.14805,
  title  = {Few-Shot Video Object Detection},
  author = {Qi Fan and Chi-Keung Tang and Yu-Wing Tai},
  journal= {arXiv preprint arXiv:2104.14805},
  year   = {2022}
}

备注

ECCV 2022