中文

融合人体解析与姿态网络的人体动作识别

计算机视觉与模式识别 2023-07-18 v1

摘要

人体骨骼和 RGB 序列都是被广泛采用的人体动作识别输入模态。然而,骨骼缺乏外观特征,而彩色数据包含大量无关描述。为此,我们引入人体解析特征图作为一种新模态,因为它能有选择地保留身体部位的时空特征,同时过滤掉关于服装、背景等的噪声。我们提出一种融合人体解析与姿态网络(IPP-Net)用于动作识别,该网络首次以双分支方法同时利用骨骼和人体解析特征图。人体姿态分支将不同模态的紧凑骨骼表示输入图卷积网络以建模姿态特征。在人体解析分支中,利用人体检测器和解析器提取多帧身体部位解析特征,随后使用卷积骨干网络进行学习。采用两分支的后期融合得到最终预测,兼顾鲁棒的关键点和高语义的身体部位特征。在 NTU RGB+D 和 NTU RGB+D 120 基准上的大量实验一致验证了所提 IPP-Net 的有效性,其性能优于现有的动作识别方法。我们的代码公开于 https://github.com/liujf69/IPP-Net-Parsing。

关键词

引用

@article{arxiv.2307.07977,
  title  = {Integrating Human Parsing and Pose Network for Human Action Recognition},
  author = {Runwei Ding and Yuhang Wen and Jinfu Liu and Nan Dai and Fanyang Meng and Mengyuan Liu},
  journal= {arXiv preprint arXiv:2307.07977},
  year   = {2023}
}

备注

CICAI 2023 Camera-ready Version