中文

从点标签学习动作完整性以实现弱监督时序动作定位

计算机视觉与模式识别 2021-08-12 v1

摘要

我们解决的问题是:仅使用每个动作实例的单帧标签进行训练,来定位动作的时间区间。由于标签稀疏,现有工作无法学习动作完整性,导致碎片化的动作预测。本文中,我们提出了一种新颖框架,其中生成密集伪标签以为模型提供完整性引导。具体地,我们首先选择伪背景点来补充点级动作标签。然后,以这些点为种子,搜索可能包含完整动作实例且与种子一致的最优序列。为从所得序列中学习完整性,我们引入了两种新颖损失,分别从动作分数和特征相似性方面对比动作实例与背景实例。实验结果表明,我们的完整性引导确实帮助模型定位完整的动作实例,尤其在高中IoU阈值下带来大幅性能提升。此外,我们在四个基准(THUMOS'14、GTEA、BEOID和ActivityNet)上展示了方法优于现有最先进方法。值得注意的是,我们的方法甚至可与近期全监督方法相媲美,而标注成本仅为其六分之一。我们的代码见 https://github.com/Pilhyeon。

关键词

引用

@article{arxiv.2108.05029,
  title  = {Learning Action Completeness from Points for Weakly-supervised Temporal Action Localization},
  author = {Pilhyeon Lee and Hyeran Byun},
  journal= {arXiv preprint arXiv:2108.05029},
  year   = {2021}
}

备注

Accepted by ICCV 2021 (Oral). Code is available at https://github.com/Pilhyeon