无需真实世界标签学习光流、深度与场景流
计算机视觉与模式识别
2022-06-14 v2 机器学习
摘要
自监督单目深度估计使机器人能够从原始视频流中学习三维感知。这一可扩展方法利用投影几何与自运动,通过视图合成进行学习,并假设世界基本静止。在自动驾驶与人机交互中常见的动态场景违背了该假设,因此需要显式建模动态物体,例如通过估计逐像素三维运动即场景流。然而,深度与场景流的同时自监督学习是病态的,因为存在无穷多种组合可得到同一三维点。本文提出 DRAFT,一种能够通过结合合成数据与几何自监督联合学习深度、光流与场景流的新方法。基于 RAFT 架构,我们将光流作为中间任务,通过三角化引导深度与场景流的学习。我们的算法还利用跨任务的时间与几何一致性损失来改善多任务学习。在标准 KITTI 基准上,我们的 DRAFT 架构在自监督单目设定下的三项任务中同时确立了新的 SOTA。项目页面:https://sites.google.com/tri.global/draft。
引用
@article{arxiv.2203.15089,
title = {Learning Optical Flow, Depth, and Scene Flow without Real-World Labels},
author = {Vitor Guizilini and Kuan-Hui Lee and Rares Ambrus and Adrien Gaidon},
journal= {arXiv preprint arXiv:2203.15089},
year = {2022}
}
备注
Accepted to RA-L + ICRA 2022 (correct project page)