PSUMNet:统一模态部位流即可实现高效基于姿态的动作识别
计算机视觉与模式识别
2022-08-12 v1 图形学
多媒体
摘要
基于姿态的动作识别主要由将输入骨架整体处理的方法来解决,即姿态树中的关节被作为一个整体处理。然而,此类方法忽略了动作类别往往由仅涉及小部分部位关节组(如手部“竖大拇指”或腿部“踢腿”)的局部动作动态所刻画这一事实。尽管存在基于部位分组的方法,但每个部位组并未在全局姿态框架内考虑,导致此类方法存在不足。此外,常规方法采用独立的模态流(如关节、骨骼、关节速度、骨骼速度),并在这些流上多次训练其网络,极大增加了训练参数数量。为解决这些问题,我们提出 PSUMNet,一种用于可扩展且高效的基于姿态动作识别的新方法。在表示层面,我们提出基于全局框架的部位流方法,以替代常规的基于模态的流。在每个部位流内,来自多模态的相关数据被统一并由处理流水线消费。实验上,PSUMNet 在广泛使用的 NTURGB+D 60/120 数据集以及稠密关节骨架数据集 NTU 60-X/120-X 上取得了最先进的性能。PSUMNet 高效且优于那些使用多 100%–400% 参数的竞争方法。PSUMNet 也泛化到 SHREC 手势数据集并具备有竞争力的性能。总体而言,PSUMNet 的可扩展性、性能与效率使其成为动作识别及在计算受限的嵌入式与边缘设备上部署的优选。代码与预训练模型可在 https://github.com/skelemoa/psumnet 获取。
引用
@article{arxiv.2208.05775,
title = {PSUMNet: Unified Modality Part Streams are All You Need for Efficient Pose-based Action Recognition},
author = {Neel Trivedi and Ravi Kiran Sarvadevabhatla},
journal= {arXiv preprint arXiv:2208.05775},
year = {2022}
}
备注
Accepted at ECCV 2022 WCPA (https://sites.google.com/view/wcpa2022/) . Code and models at https://github.com/skelemoa/psumnet