中文

利用时序梯度进行半监督动作识别

计算机视觉与模式识别 2022-04-26 v3

摘要

半监督视频动作识别旨在使深度神经网络即使在仅有极少标注数据的情况下也能取得优异性能。然而,现有方法主要迁移自当前基于图像的方法(如 FixMatch)。由于未专门利用时序动态与固有的多模态属性,其结果可能并非最优。为了更好地利用视频中编码的时序信息,本文引入时序梯度作为一种额外的模态,以实现更具注意力的特征提取。具体而言,我们的方法显式地从时序梯度(TG)中蒸馏细粒度运动表征,并在不同模态(即 RGB 与 TG)之间施加一致性约束。在推理阶段不增加额外计算或参数的情况下,半监督动作识别的性能得到显著提升。在多种典型半监督设置(即不同比例的标注数据)下,我们的方法在三个视频动作识别基准(Kinetics-400、UCF-101 和 HMDB-51)上均取得了最先进的性能。

关键词

引用

@article{arxiv.2111.13241,
  title  = {Learning from Temporal Gradient for Semi-supervised Action Recognition},
  author = {Junfei Xiao and Longlong Jing and Lin Zhang and Ju He and Qi She and Zongwei Zhou and Alan Yuille and Yingwei Li},
  journal= {arXiv preprint arXiv:2111.13241},
  year   = {2022}
}

备注

CVPR 2022