中文

基于第一人称视频的社交行为预测

计算机视觉与模式识别 2016-11-30 v1

摘要

本文提出了一种从篮球运动员的第一人称视频中整体预测其未来运动(位置和注视方向)的方法。预测的行为反映了个体物理空间,该空间提供了采取下一步行动的可能,同时通过参与共同注意来遵循社交行为。我们的关键创新在于利用多个第一人称摄像头的三维重建来自动标注彼此的社交构型的视觉语义。我们利用了两个独特地嵌入在第一人称视频中的学习信号。在个体层面,第一人称视频记录了个人周围空间和社交布局的视觉语义,从而允许与过去的类似情境建立关联。在集体层面,第一人称视频遵循共同注意,可以将个体联系到一个群体。我们使用孪生神经网络学习群体运动的自我中心视觉语义,以检索未来轨迹。我们通过最大化一种社交兼容性度量——由他们的社交阵型预测的朝向共同注意的注视对齐——来整合所有运动员检索到的轨迹,其中共同注意的动态由一个长期循环卷积网络学习。这使我们能够刻画哪种社交构型更合理,并预测未来的群体轨迹。

关键词

引用

@article{arxiv.1611.09464,
  title  = {Social Behavior Prediction from First Person Videos},
  author = {Shan Su and Jung Pyo Hong and Jianbo Shi and Hyun Soo Park},
  journal= {arXiv preprint arXiv:1611.09464},
  year   = {2016}
}