从单目视频中无监督学习深度、相机位姿与光流
计算机视觉与模式识别
2022-10-12 v2 人工智能
摘要
我们提出DFPNet——一种从无图像序列中无监督联合学习单目深度、光流和自我运动(相机位姿)估计的系统。由于3D场景几何的性质,这三个组件是耦合的。我们利用这一事实以端到端方式联合训练所有三个组件。使用单一的复合损失函数——包含基于图像重建的深度与光流损失、双向一致性检查以及平滑损失分量——来训练网络。通过超参数调优,我们能够将模型大小减少到SOTA DFP模型的5%以下(8.4M参数)。在KITTI和Cityscapes驾驶数据集上的评估表明,即使模型尺寸显著更小,我们的模型在全部三项任务上均取得了与SOTA相当的结果。
引用
@article{arxiv.2205.09821,
title = {Unsupervised Learning of Depth, Camera Pose and Optical Flow from Monocular Video},
author = {Dipan Mandal and Abhilash Jain},
journal= {arXiv preprint arXiv:2205.09821},
year = {2022}
}
备注
8 pages, 2 figures. arXiv admin note: text overlap with arXiv:1803.02276 by other authors