中文

3C-Net:用于弱监督动作定位的类别计数与中心损失

计算机视觉与模式识别 2019-11-19 v2

摘要

时序动作定位是一个具有挑战性的计算机视觉问题,拥有众多现实世界应用。现有方法大多需要费力的帧级监督来训练动作定位模型。在这项工作中,我们提出了一个名为 3C-Net 的框架,它仅需要视频级监督(弱监督),形式为动作类别标签及其对应计数。我们引入了一种新颖的公式来学习具有增强定位能力的判别性动作特征。我们的联合公式包含三项:一个分类项以确保所学动作特征的可分离性,一个经过适配的多标签中心损失项以增强动作特征的判别力,以及一个计数损失项以划分相邻的动作序列,从而改进定位。在两个具有挑战性的基准数据集 THUMOS14 和 ActivityNet 1.2 上进行了全面实验。我们的方法在这两个数据集上为弱监督时序动作定位设立了新的最先进水平。在 THUMOS14 数据集上,与现有最先进方法相比,所提方法在平均精度均值(mAP)上取得了 4.6% 的绝对增益。源代码可在 https://github.com/naraysa/3c-net 获取。

关键词

引用

@article{arxiv.1908.08216,
  title  = {3C-Net: Category Count and Center Loss for Weakly-Supervised Action Localization},
  author = {Sanath Narayan and Hisham Cholakkal and Fahad Shahbaz Khan and Ling Shao},
  journal= {arXiv preprint arXiv:1908.08216},
  year   = {2019}
}

备注

To appear in ICCV 2019