探索人体解析模态用于动作识别
计算机视觉与模式识别
2024-01-05 v1
摘要
基于多模态的动作识别方法利用姿态和 RGB 模态取得了巨大成功。然而,骨架序列缺乏外观描述,且 RGB 图像由于模态限制而存在无关噪声。为了解决这个问题,我们引入人体解析特征图作为一种新的模态,因为它可以有选择地保留身体部位的有效语义特征,同时滤除大部分无关噪声。我们提出了一种名为集成人体解析与姿态网络的新型双分支框架,这是首个同时利用骨架和人体解析模态进行动作识别的方法。第一个人体姿态分支将鲁棒的骨架输入图卷积网络以建模姿态特征,而第二个人体解析分支也利用描述性的解析特征图通过卷积主干网络建模解析特征。这两种高级特征将通过后期融合策略有效结合,以实现更好的动作识别。在 NTU RGB+D 和 NTU RGB+D 120 基准上的大量实验一致验证了我们提出的 EPP-Net 的有效性,其优于现有的动作识别方法。我们的代码可在:https://github.com/liujf69/EPP-Net-Action 获取。
引用
@article{arxiv.2401.02138,
title = {Explore Human Parsing Modality for Action Recognition},
author = {Jinfu Liu and Runwei Ding and Yuhang Wen and Nan Dai and Fanyang Meng and Shen Zhao and Mengyuan Liu},
journal= {arXiv preprint arXiv:2401.02138},
year = {2024}
}
备注
arXiv admin note: text overlap with arXiv:2307.07977