3DV:用于深度视频中动作识别的 3D 动态体素
计算机视觉与模式识别
2020-05-13 v1
摘要
为促进基于深度的 3D 动作识别,提出 3D 动态体素(3DV)作为一种新颖的 3D 运动表示。通过 3D 空间体素化,3DV 的核心思想是利用时间秩池化将深度视频中的 3D 运动信息紧凑地编码为规则的体素集合(即 3DV)。每个可用的 3DV 体素本质上联合包含了 3D 空间与运动特征。随后将 3DV 抽象为点集并以端到端学习方式输入 PointNet++ 进行 3D 动作识别。将 3DV 转化为点集形式的直观原因在于,PointNet++ 轻量且对点集的深度特征学习有效。由于 3DV 可能丢失外观线索,还提出了多流 3D 动作识别方式以联合学习运动与外观特征。为提取更丰富的动作时间顺序信息,我们还将深度视频划分为时间片段并整体编码于 3DV 中。在 4 个成熟基准数据集上的大量实验证明了我们所提方法的优越性。令人印象深刻的是,在 NTU RGB+D 120 [13] 上我们分别取得了跨受试者与跨设置测试设定下 82.4% 和 93.5% 的准确率。3DV 的代码见 https://github.com/3huo/3DV-Action。
引用
@article{arxiv.2005.05501,
title = {3DV: 3D Dynamic Voxel for Action Recognition in Depth Video},
author = {Yancheng Wang and Yang Xiao and Fu Xiong and Wenxiang Jiang and Zhiguo Cao and Joey Tianyi Zhou and Junsong Yuan},
journal= {arXiv preprint arXiv:2005.05501},
year = {2020}
}
备注
Accepted by CVPR2020