基于加权多区域卷积神经网络的低延迟人体动作识别
计算机视觉与模式识别
2018-05-09 v1
摘要
时空上下文对于理解视频中的人体动作至关重要。近期最先进的基于卷积神经网络(ConvNet)的动作识别系统常涉及 3D 时空 ConvNet 滤波器、将视频切分为固定长度片段以及长短期记忆(LSTM)网络。此类架构旨在利用短期与长期时间上下文,但也需要累积预定义数量的视频帧(例如,为 3D ConvNet 滤波器构建视频片段,为 LSTM 生成足够输入)。对于需要针对快速变化动作场景进行低延迟在线预测的应用,本文提出了一种新的动作识别系统。所提系统称为“加权多区域卷积神经网络”(WMR ConvNet),其无 LSTM,并基于 2D ConvNet,无需为 3D ConvNet 滤波累积视频帧。不同于早期仅基于 RGB 帧与光流帧的 2D ConvNet,WMR ConvNet 被设计为同时捕获主区域(前景)与次区域(多为背景)的多个空间与短期时间线索(例如人体姿态、背景中物体的出现)。在 UCF101 与 HMDB51 数据集上,所提 WMR ConvNet 在竞争的低延迟算法中取得了最先进的性能。此外,WMR ConvNet 甚至优于需要视频帧累积的基于 3D ConvNet 的 C3D 算法。在移除光流 ConvNet 流的消融研究中,消融后的 WMR ConvNet 仍优于竞争算法。
引用
@article{arxiv.1805.02877,
title = {Low-Latency Human Action Recognition with Weighted Multi-Region Convolutional Neural Network},
author = {Yunfeng Wang and Wengang Zhou and Qilin Zhang and Xiaotian Zhu and Houqiang Li},
journal= {arXiv preprint arXiv:1805.02877},
year = {2018}
}