中文

VPN:用于日常生活活动识别的视频-姿态嵌入学习

计算机视觉与模式识别 2020-07-08 v1

摘要

本文关注日常生活活动(ADL)识别的时空方面。ADL具有两个特定属性:(i)细微的时空模式,以及(ii)随时间变化的相似视觉模式。因此,ADL可能看起来非常相似,常需观察其细粒度细节以区分。由于近期时空3D卷积网络过于刚性,难以捕捉动作间细微的视觉模式,我们提出一种新颖的视频-姿态网络:VPN。该VPN的两个关键组件是空间嵌入与注意力网络。空间嵌入将3D姿态与RGB线索投影到公共语义空间,使动作识别框架能利用两种模态学习更好的时空特征。为区分相似动作,注意力网络提供两种功能——(i)利用人体拓扑结构的端到端可学习姿态骨干,以及(ii)跨视频提供联合时空注意力权重的耦合器。实验表明,VPN在大规模人体活动数据集NTU-RGB+D 120及其子集NTU-RGB+D 60、真实世界挑战性人体活动数据集Toyota Smarthome以及小规模人-物交互数据集Northwestern UCLA上的动作分类优于最先进结果。

关键词

引用

@article{arxiv.2007.03056,
  title  = {VPN: Learning Video-Pose Embedding for Activities of Daily Living},
  author = {Srijan Das and Saurav Sharma and Rui Dai and Francois Bremond and Monique Thonnat},
  journal= {arXiv preprint arXiv:2007.03056},
  year   = {2020}
}

备注

Accepted in ECCV 2020