中文

D2-Net:基于判别性嵌入与去噪激活的弱监督动作定位

计算机视觉与模式识别 2021-08-24 v2

摘要

本工作提出了一种弱监督时间动作定位框架,称为 D2-Net,其旨在利用视频级监督对动作进行时间定位。我们的主要贡献是引入了一种新颖的损失函数设计,该设计联合增强了潜在嵌入的判别性,以及输出时间类别激活相对于由弱监督引起的前景-背景噪声的鲁棒性。所提出的公式包含一个判别性损失项和一个去噪损失项,用于增强时间动作定位。判别性项结合了分类损失,并利用自顶向下的注意力机制来增强潜在前景-背景嵌入的可分离性。去噪损失项通过利用自底向上的注意力机制同时最大化视频内和视频间的互信息,显式地处理类别激活中的前景-背景噪声。因此,前景区域的激活被增强,而背景区域的激活被抑制,从而带来更鲁棒的预测。我们在多个基准上进行了全面实验,包括 THUMOS14 和 ActivityNet1.2。我们的 D2-Net 在所有数据集上与现有方法相比均表现优异,在 THUMOS14 上于 IoU=0.5 时的 mAP 指标上取得了高达 2.3% 的提升。源代码可在 https://github.com/naraysa/D2-Net 获取。

关键词

引用

@article{arxiv.2012.06440,
  title  = {D2-Net: Weakly-Supervised Action Localization via Discriminative Embeddings and Denoised Activations},
  author = {Sanath Narayan and Hisham Cholakkal and Munawar Hayat and Fahad Shahbaz Khan and Ming-Hsuan Yang and Ling Shao},
  journal= {arXiv preprint arXiv:2012.06440},
  year   = {2021}
}

备注

ICCV 2021. Source code at https://github.com/naraysa/D2-Net