中文

EGO-TOPO:从第一人称视频中学习的场景功能可供性

计算机视觉与模式识别 2020-03-31 v2

摘要

第一人称视频自然地将物理环境的使用置于前沿,因为它展示了佩戴相机者基于其意图在空间中的流畅交互。然而,当前方法很大程度上将观察到的动作与持久的空间本身分离。我们引入了一种直接从第一人称视频中学习的场景可供性模型。主要思想是获得一个以人为中心的物理空间(如厨房)模型,该模型捕捉(1)主要的交互空间区域和(2)它们所支持的可能活动。我们的方法将空间分解为源自第一人称活动的拓扑地图,将自我视频组织为对不同时区的一系列访问。此外,我们展示了如何跨多个相关环境(例如,来自多个厨房的视频)链接区域,以获得环境功能的整合表示。在 EPIC-Kitchens 和 EGTEA+ 上,我们展示了用于学习场景可供性和在长视频中预测未来动作的方法。

关键词

引用

@article{arxiv.2001.04583,
  title  = {EGO-TOPO: Environment Affordances from Egocentric Video},
  author = {Tushar Nagarajan and Yanghao Li and Christoph Feichtenhofer and Kristen Grauman},
  journal= {arXiv preprint arXiv:2001.04583},
  year   = {2020}
}

备注

Published in CVPR 2020, project page: http://vision.cs.utexas.edu/projects/ego-topo/