中文

HAA4D:基于三维时空骨架对齐的小样本人体原子动作识别

计算机视觉与模式识别 2022-02-16 v1

摘要

人体动作涉及复杂的姿态变化,其二维投影可能具有高度歧义性。因此,作为光度与视角不变的三维时空或四维(即 3D+T)人体骨架,是优于 2D+T 骨架/像素以提升动作识别精度的极佳替代方案。本文提出一个新的四维数据集 HAA4D,其包含 300 个人体原子动作类别的逾 3300 段 RGB 视频。HAA4D 干净、多样且类别均衡,其中每个类别借助四维骨架实现视角均衡,以至于每类仅需一个四维骨架便足以训练一个深度识别模型。此外,原子动作的选择使标注更为容易,因为每段视频片段仅持续数秒。HAA4D 中所有训练与测试的三维骨架均经深度对齐模型全局对齐至同一全局空间,使各骨架朝向负 z 方向。此种对齐通过减小类内差异使骨架匹配更为稳定,从而每类动作识别所需的训练样本更少。鉴于 HAA4D 的高多样性与骨架对齐特性,我们构建了首个无需繁冗修饰的小样本四维人体原子动作识别基线网络,在使用相同数量的未见类训练样本下,其性能可比拟或超越依赖嵌入空间编码而无显式骨架对齐的相关 SOTA 技术。

关键词

引用

@article{arxiv.2202.07308,
  title  = {HAA4D: Few-Shot Human Atomic Action Recognition via 3D Spatio-Temporal Skeletal Alignment},
  author = {Mu-Ruei Tseng and Abhishek Gupta and Chi-Keung Tang and Yu-Wing Tai},
  journal= {arXiv preprint arXiv:2202.07308},
  year   = {2022}
}