通过第一人称视觉学习大型环境的动作地图
计算机视觉与模式识别
2016-05-06 v1
摘要
当人们观察并与物理空间交互时,他们能够将功能关联到环境中的区域。我们的目标是通过利用从自我中心视角记录的稀疏活动演示,自动化实现对大型空间的密集功能理解。我们描述的方法能够在人们曾有过行为的大型场景以及未观察到行为的全新场景中实现功能估计。我们的方法学习并预测“动作地图(Action Maps)”,其编码了用户在不同位置执行活动的能力。通过使用自我中心相机观察人类活动,我们的方法随场景大小而扩展,无需安装多个静态监控摄像头,并且非常适合于近距离观察活动的任务。我们证明,通过捕捉环境基于外观的属性并将这些属性与活动演示相关联,我们提出的数学框架允许在新环境中预测动作地图。此外,我们通过展示一个概念验证应用,初步窥探了动作地图的适用性,其中它们与活动检测协同使用以执行定位。
引用
@article{arxiv.1605.01679,
title = {Learning Action Maps of Large Environments via First-Person Vision},
author = {Nicholas Rhinehart and Kris M. Kitani},
journal= {arXiv preprint arXiv:1605.01679},
year = {2016}
}
备注
To appear at CVPR 2016