中文

在单阶段时序动作检测中解耦定位与分类

计算机视觉与模式识别 2019-04-17 v1

摘要

视频时序动作检测旨在对未修剪视频中的动作进行时间定位与识别。现有单阶段方法大多聚焦于统一两个子任务,即通过完全共享的主干网络对动作候选框进行定位与对每一候选框进行分类。然而,这种将两个子任务所有组件封装于单一网络中的设计,可能因忽视各子任务的专门特性而限制训练。本文中,我们提出一种新颖的解耦单阶段时序动作检测(Decouple-SSAD)方法,通过在一阶段框架中解耦定位与分类来缓解该问题。具体而言,设计两个并行独立分支,使各组件私有拥有表征以准确定位或分类。每个分支通过对主流的特征图施加反卷积生成一组动作锚层。每个分支通过对主流的特征图施加反卷积生成一组特征图。来自更深层次的高级语义信息由此被纳入以增强特征表征。我们在 THUMOS14 数据集上进行了广泛实验,并展示出优于最优(state-of-the-art)方法的性能。我们的代码已在线公开。

关键词

引用

@article{arxiv.1904.07442,
  title  = {Decoupling Localization and Classification in Single Shot Temporal Action Detection},
  author = {Yupan Huang and Qi Dai and Yutong Lu},
  journal= {arXiv preprint arXiv:1904.07442},
  year   = {2019}
}

备注

ICME 2019. https://github.com/HYPJUDY/Decouple-SSAD