中文

基于相机模型的自监督深度估计

计算机视觉与模式识别 2024-08-30 v2

摘要

深度估计是机器人和视觉相关任务中的关键议题.在单目深度估计中,与需要昂贵真值标注的监督学习方法相比,自监督方法因无需标注成本而具有巨大的潜力.然而,自监督学习在3D重建和深度估计性能上仍与监督学习存在较大差距.此外,规模问题也是单目无监督深度估计的主要挑战之一,其通常仍需来自GPS、LiDAR或现有地图的真值尺度进行校正.在深度学习时代,现有方法主要依赖探索图像间关系来训练无监督神经网络,而相机的物理属性(如内参和外参)往往被忽视.这些物理属性不仅是数学参数,它们是相机与物理世界相互作用的实体.通过将这些物理属性嵌入深度学习模型,我们可以基于物理原理计算地面区域和与地面相连的区域的深度先验,从而提供无需额外传感器的自由监督信号.这种方法既简单易行,又能通过将相机的物理属性嵌入模型来增强所有无监督方法的效果,从而实现对现实世界的具身理解.

关键词

引用

@article{arxiv.2408.01565,
  title  = {Embodiment: Self-Supervised Depth Estimation Based on Camera Models},
  author = {Jinchang Zhang and Praveen Kumar Reddy and Xue-Iuan Wong and Yiannis Aloimonos and Guoyu Lu},
  journal= {arXiv preprint arXiv:2408.01565},
  year   = {2024}
}