中文

面向拥挤场景视频中准确的人级动作识别

计算机视觉与模式识别 2020-10-19 v1

摘要

在拥挤场景视频中检测并识别人体动作是一个具有挑战性的问题,原因在于复杂的环境与多样的 events。先前的工作总是在两方面未能妥善处理该问题:(1) 缺乏利用场景信息;(2) 缺乏拥挤与复杂场景下的训练数据。本文聚焦于通过充分利用场景信息并收集新数据来改进时空动作识别。采用自顶向下策略以克服上述局限。具体而言,我们采用强人体检测器来检测每帧的空间位置。随后,我们将动作识别模型应用于从 HIE 数据集及来自互联网的具有多样场景的新数据上的视频帧,以学习时空信息,从而提升模型的泛化能力。此外,场景信息由语义分割模型提取以辅助该过程。最终,我们的方法取得了平均 26.05 wf_mAP(在 ACM MM grand challenge 2020: Human in Events 中排名第 1)。

关键词

引用

@article{arxiv.2010.08365,
  title  = {Toward Accurate Person-level Action Recognition in Videos of Crowded Scenes},
  author = {Li Yuan and Yichen Zhou and Shuning Chang and Ziyuan Huang and Yunpeng Chen and Xuecheng Nie and Tao Wang and Jiashi Feng and Shuicheng Yan},
  journal= {arXiv preprint arXiv:2010.08365},
  year   = {2020}
}

备注

1'st Place in ACM Multimedia Grand Challenge: Human in Events, Track4: Person-level Action Recognition in Complex Events