DidSee:面向材质无关的机器人感知与操作的基于扩散的深度补全
计算机视觉与模式识别
2025-06-30 v2
摘要
商用 RGB-D 相机经常为非朗伯物体生成含噪、不完整的深度图。由于训练数据的多样性和规模有限,传统的深度补全方法难以泛化。最近的进展利用从预训练文本到图像的扩散模型中提取的视觉先验来增强密集预测任务的泛化能力。然而,我们发现原始扩散框架中训练与推理不匹配所产生的偏差显著损害了深度补全性能。此外,非朗伯区域缺乏明显的视觉特征进一步阻碍了精确预测。为了解决这些问题,我们提出了 DidSee,这是一个用于非朗伯物体深度补全的基于扩散的框架。首先,我们集成了一个重缩放噪声调度器,强制执行零终端信噪比以消除信号泄漏偏差。其次,我们设计了一种与噪声无关的单步训练公式,以减轻由曝光偏差引起的误差累积,并使用任务特定损失优化模型。最后,我们加入了一个语义增强器,能够联合进行深度补全和语义分割,将物体与背景区分开来,生成精确、细粒度的深度图。DidSee 在多个基准上取得了 SOTA 性能,展示了鲁棒的真实世界泛化能力,并有效改善了下游任务,如类别级姿态估计和机器人抓取。
引用
@article{arxiv.2506.21034,
title = {DidSee: Diffusion-Based Depth Completion for Material-Agnostic Robotic Perception and Manipulation},
author = {Wenzhou Lyu and Jialing Lin and Wenqi Ren and Ruihao Xia and Feng Qian and Yang Tang},
journal= {arXiv preprint arXiv:2506.21034},
year = {2025}
}
备注
Project page: https://wenzhoulyu.github.io/DidSee/