VPN:用于日常生活活动识别的视频-姿态嵌入学习
计算机视觉与模式识别
2020-07-08 v1
摘要
本文关注日常生活活动(ADL)识别的时空方面。ADL具有两个特定属性:(i)细微的时空模式,以及(ii)随时间变化的相似视觉模式。因此,ADL可能看起来非常相似,常需观察其细粒度细节以区分。由于近期时空3D卷积网络过于刚性,难以捕捉动作间细微的视觉模式,我们提出一种新颖的视频-姿态网络:VPN。该VPN的两个关键组件是空间嵌入与注意力网络。空间嵌入将3D姿态与RGB线索投影到公共语义空间,使动作识别框架能利用两种模态学习更好的时空特征。为区分相似动作,注意力网络提供两种功能——(i)利用人体拓扑结构的端到端可学习姿态骨干,以及(ii)跨视频提供联合时空注意力权重的耦合器。实验表明,VPN在大规模人体活动数据集NTU-RGB+D 120及其子集NTU-RGB+D 60、真实世界挑战性人体活动数据集Toyota Smarthome以及小规模人-物交互数据集Northwestern UCLA上的动作分类优于最先进结果。
引用
@article{arxiv.2007.03056,
title = {VPN: Learning Video-Pose Embedding for Activities of Daily Living},
author = {Srijan Das and Saurav Sharma and Rui Dai and Francois Bremond and Monique Thonnat},
journal= {arXiv preprint arXiv:2007.03056},
year = {2020}
}
备注
Accepted in ECCV 2020