基于单目视频的碰撞时间预测:可行性、数据集与挑战
机器人学
2020-11-03 v3
摘要
我们探索使用单个单目相机来预测由用户推动的箱形机器人与附近其他行人之间的碰撞时间。我们开发了一种纯基于图像的深度学习方法,直接估计碰撞时间,无需依赖显式几何深度估计或速度信息来预测未来碰撞。先前工作聚焦于在无人机导航背景下检测即时碰撞,其检测仅限于二值变量(即碰撞或无碰撞)。我们提出了一种更细粒度的碰撞预测方法,以毫秒为单位预测确切的碰撞时间,这对于动态路径规划中的碰撞避免更有帮助。为评估我们的方法,我们收集了一个新颖的数据集,包含超过 13000 段室内视频片段,每段均显示至少一人轨迹终结于与安装在移动箱形平台上的相机近距离接近(近碰撞)。使用该数据集,我们对不同时间窗口作为输入、采用详尽的最先进卷积神经网络(CNN)列表进行了大量实验。结果表明,我们提出的多流 CNN 是预测近碰撞时间的最佳模型。在测试视频中,我们的近碰撞时间平均预测误差为 0.75 秒。
引用
@article{arxiv.1903.09102,
title = {Forecasting Time-to-Collision from Monocular Video: Feasibility, Dataset, and Challenges},
author = {Aashi Manglik and Xinshuo Weng and Eshed Ohn-Bar and Kris M. Kitani},
journal= {arXiv preprint arXiv:1903.09102},
year = {2020}
}
备注
Accepted at IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), 2019. Project page: https://aashi7.github.io/NearCollision.html