中文

在第三人称视频中识别第一人称相机佩戴者

计算机视觉与模式识别 2017-04-24 v1

摘要

我们考虑这样一种场景:希望在多人佩戴身体相机,同时又有第三人称静态相机捕捉场景的环境中,执行联合场景理解、物体跟踪、活动识别及其他任务。为此,我们需要建立第一人称和第三人称视频之间的人级对应关系,这是一项具有挑战性的任务,因为相机佩戴者在其自身的自我中心视频中不可见,从而阻碍了直接特征匹配的使用。在本文中,我们提出了一种新的半孪生卷积神经网络架构来应对这一新颖挑战。我们将该问题公式化为学习第一人称和第三人称视频的联合嵌入空间,该空间同时考虑空间和运动域线索。设计了一种新的三元组损失函数,以最小化正确的第一人称与第三人称匹配之间的距离,同时最大化错误匹配之间的距离。这种端到端的方法表现显著优于多个基线,部分原因在于它联合学习了针对匹配优化的第一人称和第三人称特征以及距离度量本身。

关键词

引用

@article{arxiv.1704.06340,
  title  = {Identifying First-person Camera Wearers in Third-person Videos},
  author = {Chenyou Fan and Jangwon Lee and Mingze Xu and Krishna Kumar Singh and Yong Jae Lee and David J. Crandall and Michael S. Ryoo},
  journal= {arXiv preprint arXiv:1704.06340},
  year   = {2017}
}