PoseConvGRU:一种基于学习的单目视觉自运动估计方法
计算机视觉与模式识别
2019-06-20 v1 机器学习
图像与视频处理
摘要
尽管在过去十年中提出了许多视觉自运动算法变体,但基于学习的自运动估计方法因其对图像噪声的鲁棒性和独立于相机标定的理想特性而受到越来越多的关注。在这项工作中,我们提出了一种用于单目相机完全可训练的视觉自运动估计的数据驱动方法。我们采用端到端学习方法,使模型能够直接从输入图像对映射到自运动估计(参数化为6自由度变换矩阵)。为此,我们引入了一种称为PoseConvGRU的新型双模块长时序循环卷积神经网络,并带有显式的序列位姿估计损失。特征编码模块编码图像对中的短期运动特征,而记忆传播模块捕获连续图像对中的长期运动特征。视觉记忆由卷积门控循环单元实现,从而允许信息随时间传播。在每个时间步,两张连续的RGB图像堆叠在一起形成6通道张量,供模块1学习如何提取运动信息并估计位姿。然后将输出图的序列通过堆叠的ConvGRU模块,以生成每个图像对的相对变换位姿。我们还通过随机跳帧来增强训练数据,以模拟速度变化,从而在转弯和高速情况下获得更好的性能。我们在KITTI视觉里程计基准上评估了所提方法的性能。实验表明,该方法与几何方法具有竞争性的性能,并鼓励进一步探索基于学习的方法用于估计相机自运动,尽管几何方法已展现出有前景的结果。
引用
@article{arxiv.1906.08095,
title = {PoseConvGRU: A Monocular Approach for Visual Ego-motion Estimation by Learning},
author = {Guangyao Zhai and Liang Liu and Linjian Zhang and Yong Liu},
journal= {arXiv preprint arXiv:1906.08095},
year = {2019}
}
备注
33 pages,12 figures