VPN++:重新思考视频-姿态嵌入以理解日常活动
计算机视觉与模式识别
2021-05-19 v1 人工智能
摘要
已有许多尝试致力于结合RGB与3D姿态来识别日常活动(ADL)。ADL可能看起来非常相似,且常需建模细粒度细节以区分它们。由于近期3D卷积网络过于僵化而难以捕捉动作间细微的视觉模式,该研究方向由结合RGB与3D姿态的方法主导。但在缺乏合适传感器时,从RGB流计算3D姿态的成本很高。这限制了上述方法在需要低延迟的实际应用中的使用。那么,如何最好地利用3D姿态来识别ADL?为此,我们提出一种由姿态驱动的注意力机制的扩展:视频-姿态网络(VPN),探索两个不同方向。一是通过特征级蒸馏将姿态知识迁移至RGB,另一是通过注意力级蒸馏来模仿姿态驱动的注意力。最终,这两种方法被集成进单一模型,我们称之为VPN++。我们表明VPN++不仅有效,且对噪声姿态具有高加速比与高鲁棒性。VPN++在有或无3D姿态下,均在4个公开数据集上优于代表性基线。代码见 https://github.com/srijandas07/vpnplusplus。
引用
@article{arxiv.2105.08141,
title = {VPN++: Rethinking Video-Pose embeddings for understanding Activities of Daily Living},
author = {Srijan Das and Rui Dai and Di Yang and Francois Bremond},
journal= {arXiv preprint arXiv:2105.08141},
year = {2021}
}
备注
submitted to a journal