IntegralAction:用于视频中鲁棒人体动作识别的姿势驱动特征融合
计算机视觉与模式识别
2021-04-16 v2
摘要
当前大多数动作识别方法通过将整幅图像区域的 RGB 序列作为输入,严重依赖外观信息。虽然在利用人体周围上下文信息(如人体外观与场景类别)方面有效,但它们易被上下文与目标动作不完全匹配的离上下文动作视频所欺骗。相反,仅以人体骨架序列作为输入的基于姿势的方法,受限于不准确的人体姿势估计或人体姿势本身固有的歧义。将这两种方法融合已被证明并非易事;用外观与姿势同时训练模型最终会强烈偏向外观,且不能很好泛化到未见视频。为解决此问题,我们提出学习姿势驱动的特征融合,通过即时观测姿势特征来动态结合外观与姿势流。其核心思想是让姿势流根据给定姿势信息是否可靠,决定在融合中使用多少及哪些外观信息。我们展示了所提出的 IntegralAction 在上下文内与离上下文动作视频数据集上均取得高度鲁棒的性能。代码见 https://github.com/mks0601/IntegralAction_RELEASE。
引用
@article{arxiv.2007.06317,
title = {IntegralAction: Pose-driven Feature Integration for Robust Human Action Recognition in Videos},
author = {Gyeongsik Moon and Heeseung Kwon and Kyoung Mu Lee and Minsu Cho},
journal= {arXiv preprint arXiv:2007.06317},
year = {2021}
}
备注
Published at CVPRW 2021