从第一人称(自我中心)视觉预测未来:综述
计算机视觉与模式识别
2021-07-29 v1
摘要
自我中心视频能带来大量关于人类如何感知世界并与环境交互的信息,这有助于人类行为分析。得益于可穿戴设备日益普及以及新的大规模自我中心数据集带来的机遇,自我中心视频分析研究正快速发展。随着计算机视觉技术持续快速进步,与未来预测相关的任务正开始从理解当下的需求中演化出来。预测未来人类活动、轨迹及与物体的交互,在人-机器人交互、面向工业与日常生活场景的辅助可穿戴技术、娱乐以及虚拟或增强现实等应用中至关重要。本综述总结了从自我中心视觉进行未来预测的研究演进,概述了应用、设备、现存问题、常用数据集、模型与输入模态。我们的分析强调,从自我中心视觉进行未来预测的方法可在一系列应用中产生显著影响,且进一步的研究努力应致力于任务标准化,以及提出考虑具有工业取向等真实世界场景的数据集。
引用
@article{arxiv.2107.13411,
title = {Predicting the Future from First Person (Egocentric) Vision: A Survey},
author = {Ivan Rodin and Antonino Furnari and Dimitrios Mavroedis and Giovanni Maria Farinella},
journal= {arXiv preprint arXiv:2107.13411},
year = {2021}
}
备注
Computer Vision and Image Understanding, 2021