中文

R-C3D:用于时序活动检测的区域卷积 3D 网络

计算机视觉与模式识别 2017-09-04 v2

摘要

我们致力于解决连续、未裁剪视频流中的活动检测问题。这是一项困难的任务,需要提取有意义的时空特征以捕捉活动,并准确确定每个活动的起止时间。我们引入了一个新模型,区域卷积 3D 网络 (Region Convolutional 3D Network, R-C3D),该模型使用三维全卷积网络对视频流进行编码,然后生成包含活动的候选时序区域,最后将选定的区域分类为特定活动。由于提议与分类流程之间共享卷积特征,从而节省了计算量。整个模型通过联合优化的定位与分类损失进行端到端训练。R-C3D 比现有方法更快(在单块 Titan X Maxwell GPU 上达到每秒 569 帧),并在 THUMOS'14 上取得了 SOTA 结果。我们通过在 ActivityNet 和 Charades 上评估我们的方法,进一步证明我们的模型是一个通用的活动检测框架,不依赖于对特定数据集属性的假设。我们的代码可在 http://ai.bu.edu/r-c3d/ 获取。

关键词

引用

@article{arxiv.1703.07814,
  title  = {R-C3D: Region Convolutional 3D Network for Temporal Activity Detection},
  author = {Huijuan Xu and Abir Das and Kate Saenko},
  journal= {arXiv preprint arXiv:1703.07814},
  year   = {2017}
}

备注

ICCV 2017 Camera Ready Version