关注要点:利用图卷积网络学习上下文的弱监督动作检测
机器学习
2021-07-30 v1 计算机视觉与模式识别
摘要
时空动作检测的主流范式是使用由2D或3D卷积网络学习的时空特征对动作进行分类。我们认为若干动作由其上下文表征,例如视频中存在的相关物体和参与者。为此,我们引入一种基于自注意力和图卷积网络的架构,以建模上下文线索,如参与者-参与者和参与者-物体交互,从而改进视频中的人体动作检测。我们有兴趣在弱监督设定下实现这一点,即在动作边界框方面使用尽可能少的标注。我们的模型通过将学习到的上下文可视化为注意力图(即使对于训练期间未见的动作和物体)来辅助可解释性。我们通过引入基于注意力图检索物体的召回率的定量度量,评估我们的模型突出相关上下文的效果。我们的模型依赖于3D卷积RGB流,且不需要昂贵的光流计算。我们在DALY数据集上评估我们的模型,该数据集由人-物交互动作组成。实验结果表明,我们的上下文方法在Video-mAP上超过基线动作检测方法2个多百分点。代码可在\url{https://github.com/micts/acgcn}获取
引用
@article{arxiv.2107.13648,
title = {Spot What Matters: Learning Context Using Graph Convolutional Networks for Weakly-Supervised Action Detection},
author = {Michail Tsiaousis and Gertjan Burghouts and Fieke Hillerström and Peter van der Putten},
journal= {arXiv preprint arXiv:2107.13648},
year = {2021}
}
备注
Paper presented at the International Workshop on Deep Learning for Human-Centric Activity Understanding (DL-HAU2020), January 11, 2021