中文

用于弱监督时序动作定位的前景-动作一致性网络

计算机视觉与模式识别 2021-08-17 v1

摘要

作为高级视频理解中的一项挑战性任务,弱监督时序动作定位已吸引越来越多的关注。在仅使用视频标注的情况下,多数现有方法试图以定位-by-分类框架处理该任务,通常采用选择器选取高动作概率(即前景)的片段。然而,现有前景选择策略有一主要局限:仅考虑从前景到动作的单侧关系,无法保证前景-动作一致性。本文提出基于 I3D 骨干的 FAC-Net 框架,其上附加三个分支:类明智前景分类分支、类无关注意力分支与多示例学习分支。首先,我们的类明智前景分类分支正则化动作与前景间关系以最大化前景-背景分离。此外,采用类无关注意力分支与多示例学习分支正则化前景-动作一致性并帮助学习有意义的前景分类器。在各分支内,我们引入混合注意力机制,其对每个片段计算多个注意力分数,以同时关注判别性与弱判别性片段来捕获完整动作边界。在 THUMOS14 与 ActivityNet1.3 上的实验结果展示了我们方法的 SOTA 性能。我们的代码见 https://github.com/LeonHLJ/FAC-Net。

关键词

引用

@article{arxiv.2108.06524,
  title  = {Foreground-Action Consistency Network for Weakly Supervised Temporal Action Localization},
  author = {Linjiang Huang and Liang Wang and Hongsheng Li},
  journal= {arXiv preprint arXiv:2108.06524},
  year   = {2021}
}

备注

Accepted by ICCV 2021. Code is available at https://github.com/LeonHLJ/FAC-Net