用于从无约束单目视频进行无监督深度估计的区域形变网络
计算机视觉与模式识别
2019-05-24 v2
摘要
尽管基于学习的图像/视频深度估计已取得实质性进展,仍存在固有局限。有监督方法受限于少量真值或标注数据,而单目视频的无监督方法大多基于静态场景假设,在存在动态物体的真实世界场景中表现不佳。本文提出一种由DepthNet、PoseNet与区域形变网络(RDN)组成的新型基于学习的方法,用于在无真值监督下从非约束单目视频估计深度。核心贡献在于RDN对各类物体(如刚体运动的汽车与可形变的人体)的刚性与非刚性运动进行恰当处理。特别地,提出一种基于形变的2D图像上个体物体运动表示。该表示使我们的方法可适用于多样的无约束单目视频。我们的方法不仅在标准基准KITTI与Cityscapes上取得最先进结果,也在拥挤行人跟踪数据集上展示出有前景的结果,证明了基于形变的运动表示的有效性。代码与训练模型见 https://github.com/haofeixu/rdn4depth。
引用
@article{arxiv.1902.09907,
title = {Region Deformer Networks for Unsupervised Depth Estimation from Unconstrained Monocular Videos},
author = {Haofei Xu and Jianmin Zheng and Jianfei Cai and Juyong Zhang},
journal= {arXiv preprint arXiv:1902.09907},
year = {2019}
}
备注
IJCAI 2019