中文

基于骨架序列与RGB单帧的多模态特征融合网络用于动作识别

计算机视觉与模式识别 2022-02-24 v1

摘要

动作识别因在视觉系统中的广泛应用而成为计算机视觉领域的热点话题。已有方法通过融合骨架序列与RGB视频两种模态取得了性能提升。然而,由于RGB视频网络的高复杂性,这类方法在精度与效率之间面临两难。为解决该问题,我们提出一种多模态特征融合网络,以RGB单帧而非RGB视频与骨架序列进行模态融合,因为骨架序列与RGB单帧组合所包含的关键信息接近于骨架序列与RGB视频的组合。如此一来,在大幅降低复杂度的同时保留了互补信息。为更好地挖掘两种模态间的对应关系,网络中引入了一个两阶段融合框架。在早期融合阶段,我们提出一个骨架注意力模块,将骨架序列投影到单张RGB帧上,以帮助RGB帧聚焦于肢体运动区域。在后期融合阶段,我们提出一个交叉注意力模块,通过利用相关性来融合骨架特征与RGB特征。在NTU RGB+D和SYSU两个基准上的实验表明,所提模型在取得与最先进方法相当性能的同时,降低了网络复杂度。

关键词

引用

@article{arxiv.2202.11374,
  title  = {Skeleton Sequence and RGB Frame Based Multi-Modality Feature Fusion Network for Action Recognition},
  author = {Xiaoguang Zhu and Ye Zhu and Haoyu Wang and Honglin Wen and Yan Yan and Peilin Liu},
  journal= {arXiv preprint arXiv:2202.11374},
  year   = {2022}
}

备注

Accepted by ACM Transactions on Multimedia Computing, Communications, and Applications (TOMM)