动态场景中用于物体与自运动估计的稀疏表示
计算机视觉与模式识别
2020-08-31 v1 机器学习
摘要
同时包含物体运动与自运动的动态场景对单目视觉里程计(VO)构成挑战。单目 VO 的另一个问题是尺度模糊性,即这些方法无法以真实尺度估计场景深度与相机运动。此处,我们提出一种基于学习的方法,通过对深度图变化与离群点边缘化,直接从光流预测相机运动参数。这通过在一个自编码器网络中学习自运动的稀疏过完备基集实现,该网络能为相机参数或运动场估计任务消除光流中的无关分量。模型使用稀疏正则化与有监督自运动损失训练,并在 KITTI 与 Virtual KITTI 数据集上分别取得轨迹预测与相机旋转预测任务的当前最优性能。模型学习的稀疏潜空间自运动表示具有鲁棒性,仅需 5% 的隐藏层神经元即可在 KITTI 数据集上保持最佳轨迹预测精度。此外,在存在深度信息时,所提方法通过对预测自运动进行全局补偿与除式归一化过程,对大范围物体尺寸与速度表现出可靠的物体速度预测。
引用
@article{arxiv.1903.03731,
title = {Sparse Representations for Object and Ego-motion Estimation in Dynamic Scenes},
author = {Hirak J Kashyap and Charless Fowlkes and Jeffrey L Krichmar},
journal= {arXiv preprint arXiv:1903.03731},
year = {2020}
}
备注
With supplementary material