中文

面向智能视频监控中动作识别的真实世界图卷积网络(RW-GCNs)

计算机视觉与模式识别 2022-01-19 v1 机器学习

摘要

动作识别是新兴的边缘端智能视频监控与安全系统的关键算法环节。基于骨架的动作识别是一种有吸引力的方法,它不使用 RGB 像素数据,而是依赖人体姿态信息对相应动作进行分类。然而,现有算法常假设理想条件,不能代表真实世界的限制,如噪声输入、延迟要求和边缘资源约束。为应对现有方法的局限,本文提出真实世界图卷积网络(RW-GCNs),一种用于满足真实世界基于骨架的动作识别领域约束的架构级方案。受人类视觉皮层中反馈连接存在的启发,RW-GCNs 在现有近最先进(SotA)时空图卷积网络(ST-GCNs)上利用注意力反馈增强。ST-GCNs 的设计选择源于以信息论为中心的原则,以应对端到端实时与边缘端智能视频系统中典型遇到的空间与时间噪声。我们的结果表明 RW-GCNs 能够服务于这些应用:在 NTU-RGB-D-120 数据集上以 94.1% 准确率取得新 SotA,且在空间关键点噪声存在下于 Northwestern UCLA 数据集上以 90.4% 准确率实现比基线 ST-GCN 应用低 32 倍的延迟。RW-GCNs 进一步通过在 10 倍成本效益的 NVIDIA Jetson Nano(而非 NVIDIA Xavier NX)上运行展现系统可扩展性,同时在资源受限设备上仍保持可观的吞吐范围(每秒 15.6 至 5.5 个动作)。代码见:https://github.com/TeCSAR-UNCC/RW-GCN。

关键词

引用

@article{arxiv.2201.05739,
  title  = {Real-World Graph Convolution Networks (RW-GCNs) for Action Recognition in Smart Video Surveillance},
  author = {Justin Sanchez and Christopher Neff and Hamed Tabkhi},
  journal= {arXiv preprint arXiv:2201.05739},
  year   = {2022}
}