中文

基于深度度量学习的弱监督时序动作定位

计算机视觉与模式识别 2020-01-23 v1 机器学习

摘要

时序动作定位是视频理解的重要步骤。当前大多数动作定位方法依赖于带有动作实例完整时序标注的未剪辑视频。然而,标注视频的动作标签和时序边界既昂贵又耗时。为此,我们提出了一种弱监督时序动作定位方法,该方法在训练期间仅需要视频级别的动作实例作为监督。我们提出一个分类模块为视频中每个片段生成动作标签,以及一个深度度量学习模块来学习不同动作实例之间的相似性。我们使用标准反向传播算法联合优化平衡二元交叉熵损失和度量损失。大量实验证明了这两个组件在时序定位中的有效性。我们在两个具有挑战性的未剪辑视频数据集 THUMOS14 和 ActivityNet1.2 上评估了我们的算法。我们的方法在 IoU 阈值为 0.5 时将 THUMOS14 的当前最优结果提升了 6.5% mAP,并在 ActivityNet1.2 上取得了具有竞争力的性能。

关键词

引用

@article{arxiv.2001.07793,
  title  = {Weakly Supervised Temporal Action Localization Using Deep Metric Learning},
  author = {Ashraful Islam and Richard J. Radke},
  journal= {arXiv preprint arXiv:2001.07793},
  year   = {2020}
}

备注

accepted to WACV 2020