中文

将视频表示为判别性子图用于动作识别

计算机视觉与模式识别 2022-01-12 v1

摘要

人类动作通常具有组合结构或模式,即主体、物体以及二者间的时空交互。因此,发现此类结构是一种对交互动态进行推理并识别动作的有效途径。本文引入一种子图新设计,以表示并编码视频中每个动作的判别性模式。具体而言,我们提出多尺度子图学习(MUSLE)框架,其新颖地构建时空图,并按节点数在各尺度上将图聚类为紧凑子图。在技术上,MUSLE 在每个视频片段中生成 3D 边界框(即管状片段)作为图节点,并以管状片段间的稠密连接作为图边。对于每个动作类别,我们执行在线聚类,通过高斯混合层学习将图分解为各尺度上的子图,并选取判别性子图作为动作原型用于识别。在 Something-Something V1 与 V2 及 Kinetics-400 数据集上进行了充分实验,与最先进(SOTA)方法相比报告了优越结果。更值得注意的是,我们的 MUSLE 在 Something-Something V2 验证集上取得了迄今最佳报告准确率 65.0%。

关键词

引用

@article{arxiv.2201.04027,
  title  = {Representing Videos as Discriminative Sub-graphs for Action Recognition},
  author = {Dong Li and Zhaofan Qiu and Yingwei Pan and Ting Yao and Houqiang Li and Tao Mei},
  journal= {arXiv preprint arXiv:2201.04027},
  year   = {2022}
}

备注

CVPR 2021