S3D:基于全三维卷积网络的单发多时段检测器
计算机视觉与模式识别
2018-08-09 v2
摘要
本文提出一种新颖的单发多时段检测器(S3D),用于长而未裁剪视频中的时序活动检测,采用简单的端到端全三维卷积(Conv3D)网络。我们的架构名为 S3D,对整段视频流进行编码,并将时序活动时段的输出空间离散化为一组分布于不同时序位置与尺度的默认时段。在预测时,S3D 预测各默认时段内存在活动类别的分数,并相对于时段位置产生时序调整以预测精确的活动时长。与许多需要独立提议与分类阶段的最先进系统不同,我们的 S3D 本质简洁且专为单发、端到端时序活动检测而设计。在 THUMOS'14 检测基准上评估时,S3D 取得了最先进性能,且非常高效,能以 1271 FPS 运行。
引用
@article{arxiv.1807.08069,
title = {S3D: Single Shot multi-Span Detector via Fully 3D Convolutional Networks},
author = {Da Zhang and Xiyang Dai and Xin Wang and Yuan-Fang Wang},
journal= {arXiv preprint arXiv:1807.08069},
year = {2018}
}
备注
BMVC 2018 Oral