基于无提议掩码的半监督时序动作检测
计算机视觉与模式识别
2022-07-15 v1 人工智能
机器学习
多媒体
摘要
现有的时序动作检测(TAD)方法依赖于大量带有片段级标注的训练数据。因此,收集和标注此类训练集成本高昂且难以扩展。半监督 TAD(SS-TAD)通过利用大规模自由可获取的未标注视频来缓解该问题。然而,SS-TAD 也比有监督 TAD 更具挑战性,因此研究甚少。先前的 SS-TAD 方法直接将现有的基于提议的 TAD 方法与 SSL 方法结合。由于其顺序式的定位(如提议生成)与分类设计,它们容易出现提议错误传播。为克服该局限,本文提出一种新颖的基于无提议时序掩码(SPOT)的半监督时序动作检测模型,采用并行的定位(掩码生成)与分类架构。这一新颖设计通过切断两者之间的错误传播路径,有效消除了定位与分类间的依赖。我们进一步引入分类与定位间的交互机制以优化预测,并提出一种新的用于自监督模型预训练的 pretext task。在两个标准基准上的大量实验表明,我们的 SPOT 优于当前最优替代方法,且常大幅领先。SPOT 的 PyTorch 实现见 https://github.com/sauradip/SPOT
引用
@article{arxiv.2207.07059,
title = {Semi-Supervised Temporal Action Detection with Proposal-Free Masking},
author = {Sauradip Nag and Xiatian Zhu and Yi-Zhe Song and Tao Xiang},
journal= {arXiv preprint arXiv:2207.07059},
year = {2022}
}
备注
ECCV 2022; Code available at https://github.com/sauradip/SPOT