中文

基于 SNN 驱动的稀疏时空数据融合多模态人类动作识别

计算机视觉与模式识别 2025-12-23 v2

摘要

基于 RGB 和骨架数据融合的多模态人类动作识别虽然有效,但受到显著局限性的制约,例如高计算复杂度、过多的内存消耗以及巨大的能量需求,尤其是在使用人工神经网络(ANN)实现时。这些局限性限制了其在资源受限场景下的适用性。为了应对这些挑战,我们提出了一种新颖的脉冲神经网络(SNN)驱动框架,利用事件相机和骨架数据进行多模态人类动作识别。我们的框架以两项关键创新为中心:(1) 一种新颖的多模态 SNN 架构,对每种模态采用不同的骨干网络——用于事件相机数据的基于 SNN 的 Mamba 和用于骨架数据的脉冲图卷积网络(SGN)——并结合脉冲语义提取模块以捕获深度语义表示;以及 (2) 一种首创的基于 SNN 的离散化信息瓶颈机制用于模态融合,该机制有效平衡了模态特定语义的保留与高效的信息压缩。为了验证我们的方法,我们提出了一种构建融合事件相机和骨架数据的多模态数据集的新方法,以实现全面评估。大量实验表明,我们的方法在识别准确率和能效方面均取得了优异的性能,为实际应用提供了一种有前景的解决方案。

关键词

引用

@article{arxiv.2502.13385,
  title  = {SNN-Driven Multimodal Human Action Recognition via Sparse Spatial-Temporal Data Fusion},
  author = {Naichuan Zheng and Hailun Xia and Zeyu Liang and Yuchen Du},
  journal= {arXiv preprint arXiv:2502.13385},
  year   = {2025}
}