中文

基于不确定性建模的弱监督时间动作定位

计算机视觉与模式识别 2020-12-18 v3 机器学习

摘要

弱监督时间动作定位旨在仅利用视频级标签学习检测动作类的时间区间。为此,将动作类帧与背景帧(即不属于任何动作类的帧)分离至关重要。在本文中,我们提出一种关于背景帧的新视角,将其建模为不一致的分布外样本。然后,可通过估计每帧为分布外的概率(即不确定性)来检测背景帧,但在无帧级标签的情况下直接学习不确定性是不可行的。为了在弱监督设定下实现不确定性学习,我们利用了多示例学习公式。此外,我们进一步引入背景熵损失,通过鼓励背景帧的分布内(动作)概率在所有动作类上均匀分布,以更好地区分背景帧。实验结果表明,我们的不确定性建模能有效减轻背景帧的干扰,并在无需额外技巧的情况下带来大幅性能提升。我们证明,在 THUMOS'14 和 ActivityNet (1.2 & 1.3) 基准上,我们的模型显著优于最先进的方法。我们的代码可在 https://github.com/Pilhyeon/WTAL-Uncertainty-Modeling 获取。

关键词

引用

@article{arxiv.2006.07006,
  title  = {Weakly-supervised Temporal Action Localization by Uncertainty Modeling},
  author = {Pilhyeon Lee and Jinglu Wang and Yan Lu and Hyeran Byun},
  journal= {arXiv preprint arXiv:2006.07006},
  year   = {2020}
}

备注

Accepted by the 35th AAAI Conference on Artificial Intelligence (AAAI 2021)