中文

社交场景理解:端到端多人动作定位与集体活动识别

计算机视觉与模式识别 2016-11-29 v1

摘要

我们提出了一个用于理解原始图像序列中人类社交行为的统一框架。我们的模型通过神经网络的单次前向传播,联合检测多个个体,推断其社交动作,并估计集体动作。我们提出了一种单一架构,该架构不依赖外部检测算法,而是以端到端方式训练生成密集的候选图,并通过一种新颖的推理方案进行细化。时间一致性通过个体级别的匹配循环神经网络来处理。完整模型以帧序列作为输入,输出检测结果以及个体动作和集体活动的估计。我们证明了我们的算法在多个公开基准上达到了 SOTA 性能。

关键词

引用

@article{arxiv.1611.09078,
  title  = {Social Scene Understanding: End-to-End Multi-Person Action Localization and Collective Activity Recognition},
  author = {Timur Bagautdinov and Alexandre Alahi and François Fleuret and Pascal Fua and Silvio Savarese},
  journal= {arXiv preprint arXiv:1611.09078},
  year   = {2016}
}