机器人定位与建图期末报告——用于自监督深度视觉里程计的顺序对抗学习
计算机视觉与模式识别
2023-09-11 v1
摘要
视觉里程计(VO)与SLAM数十年来一直通过局部运动恢复结构使用多视图几何。这些方法在低纹理图像、动态场景等挑战性场景中略有劣势。同时,利用深度神经网络提取高层特征在计算机视觉中十分普遍。对于VO,我们可以利用这些深度网络借助这些高层特征提取深度与位姿估计。于是视觉里程计任务可被建模为图像生成任务,其中位姿估计是副产品。这也可通过自监督方式实现,从而消除深度神经网络训练对数据(有监督)密集的需求。尽管一些工作尝试了类似方法[1],以往工作中的深度与位姿估计有时模糊,导致沿轨迹的误差累积(漂移)。本工作的目标是解决以往方法的这些局限,并开发一种能提供更优深度与位姿估计的方法。为此,探索了若干途径:1)建模:使用光流与循环神经网络(RNN)以利用时空相关性,从而提供更多信息进行深度估计。2)损失函数:如图1所示,部署生成对抗网络(GAN)[2]以改进深度估计(进而位姿)。这一附加损失项提升了生成图像的真实感并减少了伪影。
引用
@article{arxiv.2309.04147,
title = {Robot Localization and Mapping Final Report -- Sequential Adversarial Learning for Self-Supervised Deep Visual Odometry},
author = {Akankshya Kar and Sajal Maheshwari and Shamit Lal and Vinay Sameer Raja Kad},
journal= {arXiv preprint arXiv:2309.04147},
year = {2023}
}