R-C3D:用于时序活动检测的区域卷积 3D 网络
计算机视觉与模式识别
2017-09-04 v2
摘要
我们致力于解决连续、未裁剪视频流中的活动检测问题。这是一项困难的任务,需要提取有意义的时空特征以捕捉活动,并准确确定每个活动的起止时间。我们引入了一个新模型,区域卷积 3D 网络 (Region Convolutional 3D Network, R-C3D),该模型使用三维全卷积网络对视频流进行编码,然后生成包含活动的候选时序区域,最后将选定的区域分类为特定活动。由于提议与分类流程之间共享卷积特征,从而节省了计算量。整个模型通过联合优化的定位与分类损失进行端到端训练。R-C3D 比现有方法更快(在单块 Titan X Maxwell GPU 上达到每秒 569 帧),并在 THUMOS'14 上取得了 SOTA 结果。我们通过在 ActivityNet 和 Charades 上评估我们的方法,进一步证明我们的模型是一个通用的活动检测框架,不依赖于对特定数据集属性的假设。我们的代码可在 http://ai.bu.edu/r-c3d/ 获取。
引用
@article{arxiv.1703.07814,
title = {R-C3D: Region Convolutional 3D Network for Temporal Activity Detection},
author = {Huijuan Xu and Abir Das and Kate Saenko},
journal= {arXiv preprint arXiv:1703.07814},
year = {2017}
}
备注
ICCV 2017 Camera Ready Version