从无标注视频中学习检测与检索物体
计算机视觉与模式识别
2019-10-22 v2
摘要
学习物体检测器或检索需要带有人工标注的大型数据集。此类数据集创建成本高且耗时,因此难以大规模获取。本工作中,我们提出利用视频中旁白与物体视觉呈现的自然相关性,在无需任何人工标注的情况下学习物体检测器与检索。我们将该问题表述为带噪标签的弱监督学习,并在此约束下提出一种新颖的物体检测范式。我们通过使用对比样本处理背景拒绝,并以一种新的聚类分数应对高水平标签噪声。我们的评估基于超过5000帧中11个手动标注物体组成的集合。我们给出与弱监督方法作为基线的比较,并提供强标注上限。
引用
@article{arxiv.1905.11137,
title = {Learning to Detect and Retrieve Objects from Unlabeled Videos},
author = {Elad Amrani and Rami Ben-Ari and Tal Hakim and Alex Bronstein},
journal= {arXiv preprint arXiv:1905.11137},
year = {2019}
}
备注
ICCV 2019 Workshop on Multi-modal Video Analysis and Moments in Time Challenge