用于时序动作定位的互补边界生成器与尺度不变关系建模:ActivityNet Challenge 2020参赛方案
计算机视觉与模式识别
2020-08-27 v2
摘要
本技术报告概述了我们在提交给ActivityNet Challenge 2020任务1(\textbf{时序动作定位/检测})中所使用的方案。时序动作定位不仅需要精确标定动作实例的时间边界,还需将未裁剪视频准确分类至特定类别。本文将时序动作定位任务解耦为两个阶段(即提议生成与分类),并通过从不同但互补的视角详尽探索多个组件的影响来丰富提议多样性。具体而言,为生成高质量提议,我们考量了若干因素,包括视频特征编码器、提议生成器、提议-提议关系、尺度不平衡以及集成策略。最后,为获得准确检测,我们需进一步训练一个最优视频分类器以识别所生成的提议。我们提出的方案在时序动作定位任务上取得最先进性能,在挑战赛测试集上平均mAP达\textbf{42.26}。
引用
@article{arxiv.2007.09883,
title = {Complementary Boundary Generator with Scale-Invariant Relation Modeling for Temporal Action Localization: Submission to ActivityNet Challenge 2020},
author = {Haisheng Su and Jinyuan Feng and Hao Shao and Zhenyu Jiang and Manyuan Zhang and Wei Wu and Yu Liu and Hongsheng Li and Junjie Yan},
journal= {arXiv preprint arXiv:2007.09883},
year = {2020}
}
备注
Submitted to CVPR workshop of ActivityNet Challenge 2020