第一人称视频中的未来行人定位
计算机视觉与模式识别
2018-03-29 v2
摘要
我们提出一项新任务,用于预测第一人称视频中观察到的行人的未来位置。考虑由可穿戴摄像头持续记录的第一人称视频流。给定从完整视频流中提取的某行人的短片段,我们旨在预测该人在未来帧中的位置。为促成这种未来行人定位能力,我们作出以下三个关键观察:a) 第一人称视频通常包含显著的自运动(ego-motion),这极大影响目标行人在未来帧中的位置;b) 目标行人的尺度可作为估计第一人称视频中透视效应的显著线索;c) 第一人称视频常近距离捕捉行人,使得利用其目标姿态(例如其注视方向)来预测未来位置更为容易。我们将这三个观察纳入一个具有多流卷积-反卷积架构的预测框架。实验结果表明,我们的方法在我们新数据集以及公开社交交互数据集上均有效。
引用
@article{arxiv.1711.11217,
title = {Future Person Localization in First-Person Videos},
author = {Takuma Yagi and Karttikeya Mangalam and Ryo Yonetani and Yoichi Sato},
journal= {arXiv preprint arXiv:1711.11217},
year = {2018}
}
备注
Accepted to CVPR 2018