H-Net:利用对极几何的无监督基于注意力的立体深度估计
计算机视觉与模式识别
2021-04-26 v1
摘要
从立体图像对进行深度估计已成为计算机视觉中探索最多的应用之一,此前大多数方法依赖于全监督学习设置。然而,由于难以获取准确且可扩展的地面真实数据,全监督方法的训练具有挑战性。作为替代,自监督方法日益流行以缓解此挑战。本文中,我们提出 H-Net,一种用于无监督立体深度估计的深度学习框架,其利用对极几何来精炼立体匹配。首次使用孪生自编码器架构进行深度估计,从而能够提取校正后立体图像之间的互信息。为强制对极约束,设计了互对极注意力机制,该机制在学习的输入立体对之间的互信息时,更关注位于同一对极线上的特征对应。通过将语义信息整合进所提注意力机制,立体对应得到进一步增强。更具体地,使用最优传输算法来抑制注意力并消除在两台相机中均不可见区域内的异常值。在 KITTI2015 和 Cityscapes 上的大量实验表明,我们的方法优于顶尖的无监督立体深度估计方法,同时缩小了与全监督方法之间的差距。
引用
@article{arxiv.2104.11288,
title = {H-Net: Unsupervised Attention-based Stereo Depth Estimation Leveraging Epipolar Geometry},
author = {Baoru Huang and Jian-Qing Zheng and Stamatia Giannarou and Daniel S. Elson},
journal= {arXiv preprint arXiv:2104.11288},
year = {2021}
}