中文

用于动作识别的异步时随机场

计算机视觉与模式识别 2017-07-25 v2

摘要

动作不仅仅是运动和轨迹:我们做饭是为了吃,我们拿杯子是为了喝。对视频的透彻理解需要超越外观建模,并需要对活动序列以及诸如意图等更高层次的结构进行推理。但是我们如何对这些进行建模和推理呢?我们提出了一个全连接时序 CRF 模型,用于对活动的各个方面(包括物体、动作和意图)进行推理,其中势函数由深度网络预测。此类结构化模型的端到端训练是一项具有挑战性的工作:对于推理和学习,我们需要构建由整个视频组成的 mini-batch,导致 mini-batch 中只有少数几个视频。这会导致数据点之间产生高相关性,从而导致反向传播算法崩溃。为了应对这一挑战,我们提出了一种异步变分推断方法,允许高效的端到端训练。我们的方法在 Charades 基准测试上实现了 22.4% 的分类 mAP,优于现有技术(17.2% mAP),并在时序定位任务上提供了同等的增益。

关键词

引用

@article{arxiv.1612.06371,
  title  = {Asynchronous Temporal Fields for Action Recognition},
  author = {Gunnar A. Sigurdsson and Santosh Divvala and Ali Farhadi and Abhinav Gupta},
  journal= {arXiv preprint arXiv:1612.06371},
  year   = {2017}
}