FineAction:用于时序动作定位的细粒度视频数据集
计算机视觉与模式识别
2022-10-21 v3
摘要
时序动作定位(TAL)是视频理解中一个重要且具有挑战性的问题。然而,大多数现有的 TAL 基准建立在动作类别的粗粒度之上,这在该任务中表现出两个主要局限。首先,粗粒度动作会使定位模型过拟合于高层上下文信息,而忽略视频中的原子动作细节。其次,粗粒度动作类别常导致时间边界的模糊标注,这不适合时序动作定位。为解决这些问题,我们构建了一个新颖的大规模细粒度视频数据集,称为 FineAction,用于时序动作定位。FineAction 总共包含 17K 个未裁剪视频中标注的 106 个动作类别的 103K 个时序实例。与现有 TAL 数据集相比,我们的 FineAction 具有细粒度动作类别的丰富多样性、多实例的密集标注以及不同类别的共存动作等显著特征,这为时序动作定位带来了新的机遇与挑战。为对 FineAction 进行基准测试,我们系统地研究了几种流行时序定位方法在其上的性能,并深入分析了细粒度实例对时序动作定位的影响。作为一项微小贡献,我们提出了一种处理细粒度动作检测的简单基线方法,在 FineAction 上取得了 13.17% 的 mAP。我们相信 FineAction 能够推动时序动作定位及更广泛的研究。
引用
@article{arxiv.2105.11107,
title = {FineAction: A Fine-Grained Video Dataset for Temporal Action Localization},
author = {Yi Liu and Limin Wang and Yali Wang and Xiao Ma and Yu Qiao},
journal= {arXiv preprint arXiv:2105.11107},
year = {2022}
}
备注
Accepted by IEEE T-IP. HomePage: https://deeperaction.github.io/datasets/fineaction