YouTube-BoundingBoxes:用于视频目标检测的大规模高精度人工标注数据集
计算机视觉与模式识别
2017-03-28 v5
摘要
我们介绍一个新的大规模视频URL数据集,带有密集采样的目标边界框标注,称为YouTube-BoundingBoxes (YT-BB)。该数据集包含约380,000个时长约19秒的视频片段,自动筛选以呈现自然场景中的物体,未经编辑或后处理,录制质量常类似于手持手机摄像头。物体代表MS COCO标签集的一个子集。所有视频片段均经过人工标注,具有高精度分类标签和每秒1帧的边界框。采用级联的日益精确的人工标注确保了每一类的标签准确率高于95%以及紧密的边界框。最后,我们训练并评估了知名的深层网络架构,并报告了逐帧分类与定位的基线数据,以期为未来工作提供比较基准。我们还展示了视频的时间连续性如何潜在地用于改进此类推断。请参见PDF文件以获取下载数据所用的URL。我们希望此类大型策展语料的可用性将激发视频目标检测与跟踪的新进展。
引用
@article{arxiv.1702.00824,
title = {YouTube-BoundingBoxes: A Large High-Precision Human-Annotated Data Set for Object Detection in Video},
author = {Esteban Real and Jonathon Shlens and Stefano Mazzocchi and Xin Pan and Vincent Vanhoucke},
journal= {arXiv preprint arXiv:1702.00824},
year = {2017}
}
备注
Accepted at the Conference on Computer Vision and Pattern Recognition (CVPR) 2017