中文

基于互正则化的自底向上时间动作定位

计算机视觉与模式识别 2021-03-01 v3

摘要

近年来,时间动作定位(TAL),即在未裁剪视频中找出特定动作片段,已引起计算机视觉界越来越多的关注。TAL的先进方案涉及评估三个动作指示阶段的帧级概率,即开始、持续与结束;然后对这些预测进行后处理以得到最终定位。本文深入探究该机制,并指出已有方法将这些阶段建模为独立分类任务,忽略了它们之间的潜在时间约束。当视频输入的某些帧缺乏充足判别信息时,这会导致不正确和/或不一致的预测。为缓解此问题,我们引入两个正则项对学习过程进行互正则化:提出帧内一致性(IntraC)正则使各阶段内部预测得到验证;提出阶段间一致性(InterC)正则以保持这些阶段间的的一致性。联合优化这两项,整个框架在端到端优化过程中感知这些潜在约束。在两个流行TAL数据集 THUMOS14 与 ActivityNet1.3 上进行了实验。我们的方法在定量与定性上均明显优于基线。所提正则化亦可推广至其他TAL方法(如 TSA-Net 与 PGCN)。代码:https://github.com/PeisenZhao/Bottom-Up-TAL-with-MR

关键词

引用

@article{arxiv.2002.07358,
  title  = {Bottom-Up Temporal Action Localization with Mutual Regularization},
  author = {Peisen Zhao and Lingxi Xie and Chen Ju and Ya Zhang and Yanfeng Wang and Qi Tian},
  journal= {arXiv preprint arXiv:2002.07358},
  year   = {2021}
}

备注

Accepted by ECCV2020