中文

FineGym:面向细粒度动作理解的分层视频数据集

计算机视觉与模式识别 2020-04-15 v1

摘要

在公开基准上,当前的动作识别技术已取得巨大成功。然而,当用于现实世界应用(例如体育分析)时,其性能仍远不能令人满意,这类应用需要将活动解析为阶段并区分细微不同的动作。为将动作识别提升到新高度,我们开发了 FineGym,一个构建于体操视频之上的新数据集。与现有动作识别数据集相比,FineGym 在丰富性、质量和多样性上独具特色。特别地,它提供动作和子动作两个层级的时间标注,并具有三级语义层次。例如,“平衡木”项目将被标注为来自五组:“leap-jump-hop”、“beam-turns”、“flight-salto”、“flight-handspring”和“dismount”的基本子动作序列,其中每组中的子动作将进一步用精细定义的类别标签标注。这种新的粒度级别给动作识别带来了重大挑战,例如如何从连贯动作中解析时间结构,以及如何区分细微不同的动作类别。我们在该数据集上系统性地考察了代表性方法,并获得了若干有趣发现。我们希望该数据集能推动面向动作理解的研究。

关键词

引用

@article{arxiv.2004.06704,
  title  = {FineGym: A Hierarchical Video Dataset for Fine-grained Action Understanding},
  author = {Dian Shao and Yue Zhao and Bo Dai and Dahua Lin},
  journal= {arXiv preprint arXiv:2004.06704},
  year   = {2020}
}

备注

CVPR 2020 Oral (3 strong accepts); Project page: https://sdolivia.github.io/FineGym/