中文

以表示为中心的骨骼动作识别综述及ANUBIS基准

计算机视觉与模式识别 2025-09-16 v6

摘要

基于3D骨骼的人体动作识别已成为传统RGB与基于深度方法的强力替代,具有对环境变化的鲁棒性、计算高效性及增强的隐私性。尽管进展显著,当前研究在不同输入表示间仍呈碎片化,且缺乏反映现代现实世界挑战场景下的评估。本文提出以表示为中心的骨骼动作识别综述,按输入特征类型(关节坐标、骨骼向量、运动流与扩展表示)系统分类最先进方法,并分析这些选择如何影响时空建模策略。基于该综述的见解,我们引入ANUBIS,一个大规模、具挑战性的骨骼动作数据集,旨在弥补现有基准的关键空白。ANUBIS包含多视角(含后视)录制、复杂多人交互、细粒度与暴力动作以及当代社会行为。我们在ANUBIS上基准测试了一组多样的最先进模型,并深入分析了不同特征类型如何影响102个动作类别的识别性能。结果表明强烈的动作-特征依赖性,凸显了朴素多表示融合的局限,并指出需要任务感知、语义对齐的集成策略。本工作提供了全面的基础与实用的基准资源,旨在指导面向复杂现实场景的下一代鲁棒、可泛化骨骼动作识别系统。数据集网站、基准框架与下载链接见 https://yliu1082.github.io/ANUBIS/。

关键词

引用

@article{arxiv.2205.02071,
  title  = {Representation-Centric Survey of Skeletal Action Recognition and the ANUBIS Benchmark},
  author = {Yang Liu and Jiyao Yang and Madhawa Perera and Pan Ji and Dongwoo Kim and Min Xu and Tianyang Wang and Saeed Anwar and Tom Gedeon and Lei Wang and Zhenyue Qin},
  journal= {arXiv preprint arXiv:2205.02071},
  year   = {2025}
}