中文

用于时序动作定位的时序融合网络:提交至 ActivityNet 挑战赛 2020(任务 E)

计算机视觉与模式识别 2020-06-16 v1

摘要

本技术报告分析了我们在 HACS 竞赛(于 ActivityNet 挑战赛 2020 中举办)中所使用的时序动作定位方法。我们的任务目标是定位未剪辑视频中动作的开始时间和结束时间,并预测动作类别。首先,我们利用视频级特征信息训练多个视频级动作分类模型。通过这种方式,我们可以获得视频中动作的类别。其次,我们专注于生成高质量的时序提议。为此,我们应用 BMN 生成大量提议以获得高召回率。然后,我们通过采用一个称为 Refine Network 的级联结构网络来细化这些提议,该网络可以在真实值的监督下预测位置偏移和新的 IOU。为了使提议更准确,我们使用双向 LSTM、Nonlocal 和 Transformer 来捕获每个提议的局部特征与视频数据的全局特征之间的时序关系。最后,通过融合多个模型的结果,我们的方法在验证集上获得了 40.55% 的 mAP,在测试集上获得了 40.53% 的 mAP,并在该挑战赛中排名第一。

关键词

引用

@article{arxiv.2006.07520,
  title  = {Temporal Fusion Network for Temporal Action Localization:Submission to ActivityNet Challenge 2020 (Task E)},
  author = {Zhiwu Qing and Xiang Wang and Yongpeng Sang and Changxin Gao and Shiwei Zhang and Nong Sang},
  journal= {arXiv preprint arXiv:2006.07520},
  year   = {2020}
}

备注

To appear on CVPR 2020 HACS Workshop (Rank 1st)