中文

将整段视频作为背景:一种用于弱监督时序动作定位的对抗学习策略

计算机视觉与模式识别 2022-07-15 v1

摘要

在仅使用视频级标签的情况下,弱监督时序动作定位(WTAL)采用“先分类后定位”的范式来检测未裁剪视频中的动作并对其进行分类。由于分类的特性,在WTAL中,类特定的背景片段不可避免地会被误激活,以提升分类器的判别能力。为减轻背景的干扰,现有方法试图通过对伪片段级标注建模背景片段来扩大动作与背景之间的差异,这在很大程度上依赖于人工假设。与以往工作不同,我们提出了一种对抗学习策略,以打破挖掘伪背景片段的局限。具体而言,背景分类损失通过背景梯度增强策略迫使整段视频被视为背景,从而混淆识别模型。反之,前景(动作)损失引导模型在此条件下聚焦于动作片段。因此,两个分类损失之间的竞争驱动模型提升其动作建模能力。同时,我们设计了一种新颖的时序增强网络,以基于所提策略帮助模型构建亲和片段的时序关系,从而进一步提升动作定位性能。最后,在THUMOS14和ActivityNet1.2上进行的大量实验证明了所提方法的有效性。

关键词

引用

@article{arxiv.2207.06659,
  title  = {Forcing the Whole Video as Background: An Adversarial Learning Strategy for Weakly Temporal Action Localization},
  author = {Ziqiang Li and Yongxin Ge and Jiaruo Yu and Zhongming Chen},
  journal= {arXiv preprint arXiv:2207.06659},
  year   = {2022}
}

备注

9 pages, 5 figures, conference