社交场景理解:端到端多人动作定位与集体活动识别
计算机视觉与模式识别
2016-11-29 v1
摘要
我们提出了一个用于理解原始图像序列中人类社交行为的统一框架。我们的模型通过神经网络的单次前向传播,联合检测多个个体,推断其社交动作,并估计集体动作。我们提出了一种单一架构,该架构不依赖外部检测算法,而是以端到端方式训练生成密集的候选图,并通过一种新颖的推理方案进行细化。时间一致性通过个体级别的匹配循环神经网络来处理。完整模型以帧序列作为输入,输出检测结果以及个体动作和集体活动的估计。我们证明了我们的算法在多个公开基准上达到了 SOTA 性能。
引用
@article{arxiv.1611.09078,
title = {Social Scene Understanding: End-to-End Multi-Person Action Localization and Collective Activity Recognition},
author = {Timur Bagautdinov and Alexandre Alahi and François Fleuret and Pascal Fua and Silvio Savarese},
journal= {arXiv preprint arXiv:1611.09078},
year = {2016}
}