中文

基于脉冲时空Transformer的事件驱动高效三维人体姿态跟踪

计算机视觉与模式识别 2025-05-16 v5

摘要

事件相机作为一种捕捉场景动态的异步视觉传感器,为高效三维人体姿态跟踪带来了新机遇。现有方法通常采用现代人工神经网络(ANNs),如CNNs或Transformer,将稀疏事件转换为稠密图像或辅以额外灰度图像作为输入。然而,此类做法忽视了事件固有的稀疏性,导致冗余计算、能耗增加及潜在性能下降。受此启发,我们提出了首个仅基于事件的稀疏脉冲神经网络(SNNs)三维人体姿态跟踪框架。我们的方法无需将稀疏数据转为稠密格式或引入额外图像,从而充分利用输入事件的天然稀疏性。框架核心是一种新颖的脉冲时空Transformer,其实现脉冲姿态特征的双向时空融合,并在脉冲注意力中为二值脉冲特征提供有保证的相似性度量。此外,我们构建了大规模合成数据集SynEventHPD,涵盖广泛多样的三维人体运动及更长时间的事件流。实证实验表明,我们的方法优于现有最先进(SOTA)基于ANN的方法,仅需19.1%的FLOPs和3.6%的能耗。此外,我们的方法在此任务上超越了现有基于SNN的基准,凸显了所提SNN框架的有效性。数据集将在录用后发布,代码见 https://github.com/JimmyZou/HumanPoseTracking_SNN。

关键词

引用

@article{arxiv.2303.09681,
  title  = {Highly Efficient 3D Human Pose Tracking from Events with Spiking Spatiotemporal Transformer},
  author = {Shihao Zou and Yuxuan Mu and Wei Ji and Zi-An Wang and Xinxin Zuo and Sen Wang and Weixin Si and Li Cheng},
  journal= {arXiv preprint arXiv:2303.09681},
  year   = {2025}
}

备注

Accepted by IEEE TCSVT