中文

EPAM-Net:一种高效基于姿态驱动注意力指导的多模态视频动作识别网络

计算机视觉与模式识别 2025-03-21 v2 人工智能

摘要

现有的基于多模态的人类动作识别方法计算密集,限制了其在实时应用中的部署。本文提出了一种新型且高效的姿态驱动注意力指导多模态网络(EPAM-Net),用于视频动作识别。具体而言,我们提出eXpand temporal Shift(X-ShiftNet)卷积架构用于RGB和姿态流,以捕获来自RGB视频及其骨架序列的时空特征。X-ShiftNet 通过将Temporal Shift Module(TSM)集成到高效2D CNN 中,来解决3D CNN高计算成本的问题,实现高效时空学习。然后利用骨架特征来指导视觉网络流,聚焦于关键帧及其显著空间区域,使用所提出的空间时间注意力块。最后融合两个流的预测结果进行最终分类。实验结果表明,我们的方法在浮点运算(FLOPs)上显著降低,同时在NTU RGB-D 60、NTU RGB-D 120、PKU-MMD和Toyota SmartHome数据集上超越并与最先进的方法竞争。所提出的EPAM-Net 在FLOPs上最高可实现72.8倍降低,在网络参数数量上最高可实现48.6倍降低。代码将在 https://github.com/ahmed-nady/Multimodal-Action-Recognition 公开。

关键词

引用

@article{arxiv.2408.05421,
  title  = {EPAM-Net: An Efficient Pose-driven Attention-guided Multimodal Network for Video Action Recognition},
  author = {Ahmed Abdelkawy and Asem Ali and Aly Farag},
  journal= {arXiv preprint arXiv:2408.05421},
  year   = {2025}
}