SkeleTR:面向真实场景下基于骨架的动作识别
计算机视觉与模式识别
2023-09-21 v1
摘要
我们提出 SkeleTR,一种用于基于骨架的动作识别的新框架。与主要关注受控环境的前期工作不同,我们面向更一般的场景,通常涉及可变数量的人以及人与人之间各种形式的交互。SkeleTR 采用两阶段范式工作。它首先用图卷积对每个骨架序列的帧内人体骨架动态建模,然后使用堆叠的 Transformer 编码器来捕获对一般场景下动作识别重要的人物交互。为减轻不准确的骨架关联带来的负面影响,SkeleTR 以相对较短的骨架序列作为输入并增加序列数量。作为一个统一解决方案,SkeleTR 可直接应用于多个基于骨架的动作任务,包括视频级动作分类、实例级动作检测与组级活动识别。它还支持跨不同动作任务与数据集的迁移学习与联合训练,从而带来性能提升。在各种基于骨架的动作识别基准上评估时,SkeleTR 取得了最先进的性能。
引用
@article{arxiv.2309.11445,
title = {SkeleTR: Towrads Skeleton-based Action Recognition in the Wild},
author = {Haodong Duan and Mingze Xu and Bing Shuai and Davide Modolo and Zhuowen Tu and Joseph Tighe and Alessandro Bergamo},
journal= {arXiv preprint arXiv:2309.11445},
year = {2023}
}
备注
ICCV 2023