中文

基于姿态引导由粗到细框架的部件级动作解析

计算机视觉与模式识别 2022-09-05 v2 人工智能

摘要

视频动作识别,即将视频分类为预定义动作类型之一,一直是人工智能、多媒体和信号处理领域的热门话题。然而,现有方法通常将输入视频视为整体,并利用粗粒度的视频级类别标签学习模型,例如卷积神经网络(CNNs)。这些方法只能为视频输出一个动作类别,无法提供细粒度且可解释的线索来回答视频为何展现特定动作。因此,研究者开始关注一项新任务——部件级动作解析(PAP),其目标不仅是预测视频级动作,还要识别视频中每个人的帧级细粒度身体部件动作或交互。为此,我们针对这一具有挑战性的任务提出了一种由粗到细的框架。具体而言,我们的框架首先预测输入视频的视频级类别,然后定位身体部件并预测部件级动作。此外,为在部件级动作解析中平衡精度与计算量,我们提出利用段级特征来识别部件级动作。进一步,为克服身体部件的歧义性,我们提出一种姿态引导的位置嵌入方法来精确身体部件定位。通过在大规模数据集 Kinetics-TPS 上的综合实验,我们的框架取得了最先进的性能,并以超过 31.10% 的 ROC 分数优于现有方法。

关键词

引用

@article{arxiv.2203.04476,
  title  = {Part-level Action Parsing via a Pose-guided Coarse-to-Fine Framework},
  author = {Xiaodong Chen and Xinchen Liu and Wu Liu and Kun Liu and Dong Wu and Yongdong Zhang and Tao Mei},
  journal= {arXiv preprint arXiv:2203.04476},
  year   = {2022}
}

备注

Accepted by IEEE ISCAS 2022, 5 pages, 2 figures. arXiv admin note: text overlap with arXiv:2110.03368