中文

重新思考透明物体抓取:基于单目深度估计和实例掩码的深度完成

计算机视觉与模式识别 2026-03-26 v1

摘要

由于光学特性,透明物体常常导致深度相机生成不完整或无效的深度数据,从而降低机器人抓取的准确性和可靠性。现有方法通常直接将 RGB-D 图像输入到网络中,以期模型隐式推断深度值的可靠性。然而,这些方法在训练数据集上有效,但常常难以在实际场景中泛化,因为复杂的光照相互作用导致有效与无效深度数据分布高度可变。为此,我们提出了 ReMake,这是一个由实例掩码和单目深度估计引导的深度完成框架。通过显式区分透明区域和非透明区域,掩码使模型能够在训练时专注于从 RGB-D 输入中学习准确的深度估计。这种有针对性的监督减少了对隐式推理的依赖,提高了在实际场景中的泛化能力。此外,单目深度估计提供了透明物体与其周围环境之间的深度上下文,增强了深度预测的准确性。广泛的实验表明,我们的方法在基准数据集和实际场景中均优于现有方法,显示出卓越的准确性和泛化能力。代码和视频可在 https://chengyaofeng.github.io/ReMake.github.io/ 查看。

关键词

引用

@article{arxiv.2508.02507,
  title  = {Rethinking Transparent Object Grasping: Depth Completion with Monocular Depth Estimation and Instance Mask},
  author = {Yaofeng Cheng and Xinkai Gao and Sen Zhang and Chao Zeng and Fusheng Zha and Lining Sun and Chenguang Yang},
  journal= {arXiv preprint arXiv:2508.02507},
  year   = {2026}
}