中文

行动者与观察者:第一与第三人称视频的联合建模

计算机视觉与模式识别 2018-04-26 v1

摘要

认知神经科学的若干理论表明,当人们与世界交互或模拟交互时,他们是从第一人称自我中心视角进行的,并在第三人称(观察者)与第一人称(行动者)之间无缝迁移知识。尽管如此,由于缺乏数据,为人动作识别学习此类模型一直难以实现。本文朝此方向迈出一步,引入了 Charades-Ego,一个包含 112 人、4000 段配对视频的大规模第一与第三人称配对视频数据集。这使得学习两种视角——行动者与观察者——之间的关联成为可能。由此,我们解决了自我中心视觉研究面临的最大瓶颈之一,提供了从第一人称到网络上丰富第三人称数据的桥梁。我们利用该数据以仅弱监督方式学习第一与第三人称视频的联合表示,并展示了其将知识从第三人称迁移到第一人称领域的有效性。

关键词

引用

@article{arxiv.1804.09627,
  title  = {Actor and Observer: Joint Modeling of First and Third-Person Videos},
  author = {Gunnar A. Sigurdsson and Abhinav Gupta and Cordelia Schmid and Ali Farhadi and Karteek Alahari},
  journal= {arXiv preprint arXiv:1804.09627},
  year   = {2018}
}

备注

CVPR 2018 spotlight presentation