中文

用于长视频动作评估的混合动态-静态上下文感知注意力网络

计算机视觉与模式识别 2021-04-13 v1

摘要

动作质量评估的目标是给体育视频打分。然而,大多数现有工作仅关注视频动态信息(即运动信息),而忽略了运动员在视频中执行的具体姿态,这对于长视频中的动作评估十分重要。在本工作中,我们提出一种新颖的混合动态-静态上下文感知注意力网络(ACTION-NET)用于长视频中的动作评估。为了学习更具判别性的视频表示,我们不仅学习视频动态信息,还借助所提出的混合动态-静态架构,关注特定帧中检测到的运动员的静态姿态,其代表了特定时刻的动作质量。此外,我们利用一个由时间实例级图卷积网络单元和注意力单元组成的上下文感知注意力模块来处理两条流,以提取更鲁棒的流特征,其中前者用于探索实例间关系,后者用于为每个实例分配适当权重。最后,我们结合两条流的特征来回归最终视频分数,并由专家给出的真实分数监督。此外,我们收集并标注了新的艺术体操数据集,包含四种不同类型体操套路视频,用于长视频动作质量评估的评测。大量实验结果验证了我们所提方法的有效性,其优于相关方法。代码与数据集可在 \url{https://github.com/lingan1996/ACTION-NET} 获取。

关键词

引用

@article{arxiv.2008.05977,
  title  = {Hybrid Dynamic-static Context-aware Attention Network for Action Assessment in Long Videos},
  author = {Ling-An Zeng and Fa-Ting Hong and Wei-Shi Zheng and Qi-Zhi Yu and Wei Zeng and Yao-Wei Wang and Jian-Huang Lai},
  journal= {arXiv preprint arXiv:2008.05977},
  year   = {2021}
}

备注

ACM International Conference on Multimedia 2020