HACS:用于动作识别与时序定位的人体动作剪辑与片段数据集
计算机视觉与模式识别
2019-09-05 v3 人工智能
摘要
本文提出了一个从网络视频中收集的、用于人体动作识别与时序定位的新大规模数据集。我们称之为 HACS(Human Action Clips and Segments,人体动作剪辑与片段)。我们利用视觉分类器之间的一致与分歧,从未标注视频中自动挖掘候选短剪辑,随后由人工标注者进行验证。所得数据集被称为 HACS Clips。通过一个独立的流程,我们还收集了定义动作片段边界的标注。该结果数据集称为 HACS Segments。总体而言,HACS Clips 包含从 504K 个未裁剪视频中采样的 1.5M 个标注剪辑,HACS Segments 包含密集标注于 50K 个未裁剪视频中的 139K 个动作片段,涵盖 200 个动作类别。HACS Clips 包含的标注样本多于任何现有视频基准。这使得我们的数据集既是一个大规模动作识别基准,也是时空特征学习的极佳来源。在我们针对三个目标数据集的迁移学习实验中,HACS Clips 作为预训练源优于 Kinetics-600、Moments-In-Time 和 Sports1M。在 HACS Segments 上,我们评估了动作提议生成与动作定位的先进方法,并突出了由我们的密集时序标注所带来的新挑战。
引用
@article{arxiv.1712.09374,
title = {HACS: Human Action Clips and Segments Dataset for Recognition and Temporal Localization},
author = {Hang Zhao and Antonio Torralba and Lorenzo Torresani and Zhicheng Yan},
journal= {arXiv preprint arXiv:1712.09374},
year = {2019}
}