用于乒乓球细粒度动作分类与分割的三流 3D/1D CNN
计算机视觉与模式识别
2021-09-30 v1 人工智能
人机交互
机器学习
多媒体
摘要
本文提出了一种通过具有时空和时间卷积的三流网络从视频中提取模态的融合方法,用于体育中的细粒度动作分类。该方法被应用于 TTStroke-21 数据集,该数据集由乒乓球比赛的未裁剪视频组成。其目标是检测和分类视频中的乒乓球击球动作,这是旨在为球员提供反馈以提升其表现的更大计划的第一步。三种模态分别是原始 RGB 数据、计算出的光流和估计出的球员姿态。该网络由三个带有注意力块的分支组成。特征在网络的最末阶段使用双线性层进行融合。与以往方法相比,三种模态的使用使得在两个任务上都能实现更快的收敛和更好的性能:具有已知时间边界的击球分类以及联合分割与分类。为了向运动员提供更丰富的反馈,本文还对姿态进行了进一步的研究。
引用
@article{arxiv.2109.14306,
title = {Three-Stream 3D/1D CNN for Fine-Grained Action Classification and Segmentation in Table Tennis},
author = {Pierre-Etienne Martin and Jenny Benois-Pineau and Renaud Péteri and Julien Morlier},
journal= {arXiv preprint arXiv:2109.14306},
year = {2021}
}
备注
MMSports '21, October 20, 2021, Virtual Event,, Oct 2021, Chengdu, China