中文

面向视频动作检测的端到端半监督学习

计算机视觉与模式识别 2022-07-04 v3

摘要

本工作中,我们关注利用有标签与无标签数据的视频动作检测半监督学习。我们提出一种简单的基于端到端一致性的方法,有效利用无标签数据。视频动作检测既需要动作类别预测,也需要动作的时空定位。因此,我们研究两类约束:分类一致性与时空一致性。视频中占主导的背景与静态区域使得利用时空一致性进行动作检测具挑战性。为此,我们提出两种用于时空一致性的新颖正则约束:1) 时间相干性,和 2) 梯度平滑性。这两方面均利用了视频中动作的时间连续性,并被发现能有效利用无标签视频进行动作检测。我们在 UCF101-24 和 JHMDB-21 两个不同动作检测基准数据集上展示了所提方法的有效性。此外,我们还在 Youtube-VOS 上展示了所提方法对视频对象分割的有效性,证明其泛化能力。与近期全监督方法相比,所提方法在 UCF101-24 上仅使用 20% 标注即取得有竞争力的性能。在 UCF101-24 上,与监督方法相比,其在 0.5 f-mAP 和 v-mAP 上分别提升 +8.9% 和 +11%。

关键词

引用

@article{arxiv.2203.04251,
  title  = {End-to-End Semi-Supervised Learning for Video Action Detection},
  author = {Akash Kumar and Yogesh Singh Rawat},
  journal= {arXiv preprint arXiv:2203.04251},
  year   = {2022}
}

备注

CVPR'22