中文

基于时空 Transformer 引导扩散的骨架动作识别高效数据增强

计算机视觉与模式识别 2023-07-26 v2 人工智能 机器学习

摘要

近年来,基于骨架的人体动作因人体骨架的紧凑表示给该研究领域带来了新活力而成为研究热点。因此,研究者开始注意到利用 RGB 或其他传感器通过提取骨架信息来分析人体动作的重要性。借助深度学习(DL)的快速发展,近期出现了大量具有精细设计 DL 结构的基于骨架的人体动作方法。然而,训练良好的 DL 模型始终需要高质量且充足的数据,而这类数据在不付出高昂开销与人力的情况下难以获取。本文针对基于骨架的动作识别任务提出了一种新颖的数据增强方法,可有效生成高质量且多样的序列动作。为获得自然真实的动作序列,我们提出了去噪扩散概率模型(DDPMs),其可生成一系列合成动作序列,且生成过程由时空 Transformer(ST-Trans)精确引导。实验结果表明,我们的方法在不同的自然度与多样性指标上优于最先进的(SOTA)动作生成方法。这证明其所生成的高质量合成数据也可有效部署到现有动作识别模型中,带来显著的性能提升。

关键词

引用

@article{arxiv.2302.13434,
  title  = {Spatial-temporal Transformer-guided Diffusion based Data Augmentation for Efficient Skeleton-based Action Recognition},
  author = {Yifan Jiang and Han Chen and Hanseok Ko},
  journal= {arXiv preprint arXiv:2302.13434},
  year   = {2023}
}