中文

基于3D地图的自我中心活动识别与定位

计算机视觉与模式识别 2022-08-16 v3

摘要

给定一段第一人称视角拍摄的视频以及该视频录制处的环境上下文,我们能否识别此人正在做什么,并确定该动作在3D空间中发生于何处?我们着手解决这一具有挑战性的问题:从自我中心视频中联合识别移动用户在已知3D地图上的动作并对其进行定位。为此,我们提出一种新颖的深度概率模型。我们的模型以3D环境的分层体素表示(HVR)和自我中心视频为输入,将3D动作位置推断为潜变量,并基于视频及其潜在位置周围的上下文线索来识别动作。为评估模型,我们在Ego4D数据集的子集上进行了大量实验,该子集同时包含了人类自然行为和照片级真实的3D环境重建。我们的方法在已见与未见环境下的动作识别和3D动作定位上均展现出强劲结果。我们相信,本工作指向了自我中心视觉与3D场景理解交叉领域中一个令人振奋的研究方向。

关键词

引用

@article{arxiv.2105.09544,
  title  = {Egocentric Activity Recognition and Localization on a 3D Map},
  author = {Miao Liu and Lingni Ma and Kiran Somasundaram and Yin Li and Kristen Grauman and James M. Rehg and Chao Li},
  journal= {arXiv preprint arXiv:2105.09544},
  year   = {2022}
}

备注

European Conference on Computer Vision (ECCV) 2022