中文

透明场景深度估计的多标签立体匹配

计算机视觉与模式识别 2025-05-21 v1

摘要

本文提出一种多标签立体匹配方法,用于同时估计透明物体和透明场景中被遮挡背景的深度。不同于假设沿视差维度单峰分布并将匹配问题形式化为单标签回归问题的先前方法,我们提出一种多标签回归方案,以在透明场景的同一像素上估计多个深度值。为解决多标签回归问题,我们引入像素级多变量高斯表示,其中均值向量编码同一像素的多个深度值,协方差矩阵决定给定像素是否需要多标签表示。该表示在 GRU 框架中迭代预测。在每一次迭代中,我们首先预测均值参数的更新步骤,然后使用该更新步骤和更新后的均值参数来估计协方差矩阵。我们还合成了包含 10 个场景和 89 个物体的数据集,以验证透明场景深度估计的性能。实验表明,我们的方法在透明表面上显著提升了性能,同时保持了场景重建的背景信息。代码可在 https://github.com/BFZD233/TranScene 上获取。

关键词

引用

@article{arxiv.2505.14008,
  title  = {Multi-Label Stereo Matching for Transparent Scene Depth Estimation},
  author = {Zhidan Liu and Chengtang Yao and Jiaxi Zeng and Yuwei Wu and Yunde Jia},
  journal= {arXiv preprint arXiv:2505.14008},
  year   = {2025}
}