STAR-Net:基于时空激活重投影的动作识别
计算机视觉与模式识别
2019-02-27 v1
摘要
尽管深度相机和惯性传感器已常被用于人体动作识别,但这些传感模态在许多因成本或环境限制而无法使用的场景中并不实用。因此,近期出现了利用低成本、易获取的 RGB 相机通过深度卷积神经网络进行人体动作识别的研究兴趣。然而,迄今许多针对动作识别提出的深度卷积神经网络严重依赖直接从成像数据中学习全局外观线索,导致网络架构高度复杂、计算昂贵且难以训练。为降低网络复杂度并获取更高性能,我们引入了时空激活重投影(STAR)的概念。更具体地,我们使用一堆 3D 卷积在空间中与时间上对由人体姿态估计层生成的时空激活进行重投影。在 UTD-MHAD 和 J-HMDB 上的实验结果表明,基于所提 STAR 框架的端到端架构(我们称之为 STAR-Net)在单环境与小规模应用中表现娴熟。在 UTD-MHAD 上,STAR-Net 优于若干使用更丰富数据模态(如深度与惯性传感器)的方法。
引用
@article{arxiv.1902.10024,
title = {STAR-Net: Action Recognition using Spatio-Temporal Activation Reprojection},
author = {William McNally and Alexander Wong and John McPhee},
journal= {arXiv preprint arXiv:1902.10024},
year = {2019}
}