用于视频中活动定位的时序上下文网络
计算机视觉与模式识别
2017-08-09 v1
摘要
我们提出了一种用于精确定位人类活动时间位置的时序上下文网络。类似于 Faster-RCNN 架构,在视频中以等间隔放置跨越多个时间尺度的候选片段。我们提出了一种用于对这些候选片段进行排序的新颖表示。由于仅池化片段内部的特征不足以预测活动边界,我们构建了一种显式捕获候选片段周围上下文的表示以对其进行排序。对于候选片段内的每个时间段,以一对尺度均匀采样特征,并输入到时序卷积神经网络进行分类。对候选片段排序后,应用非极大值抑制并进行分类以获得最终的检测结果。TCN 在 ActivityNet 数据集和 THUMOS14 数据集上均优于现有方法。
引用
@article{arxiv.1708.02349,
title = {Temporal Context Network for Activity Localization in Videos},
author = {Xiyang Dai and Bharat Singh and Guyue Zhang and Larry S. Davis and Yan Qiu Chen},
journal= {arXiv preprint arXiv:1708.02349},
year = {2017}
}
备注
To appear in ICCV 2017