中文

D3RoMa:面向材料无关机器人操作的基于视差扩散的深度感知

机器人学 2024-09-26 v2

摘要

深度感知是基于 3D 视觉的机器人技术中的一个重要问题。然而,现实世界中的主动立体或 ToF 深度相机通常会产生噪声且不完整的深度数据,这构成了机器人性能的瓶颈。在这项工作中,我们提出了 D3RoMa,这是一种基于学习的立体图像对深度估计框架,能够在多样化的室内场景中预测干净且准确的深度,即使在经典深度感知完全失效的最具挑战性的透明或镜面表面场景中也是如此。我们方法的关键在于,通过使用去噪扩散概率模型预测视差图,将深度估计与恢复统一为图像到图像的翻译问题。在推理时,我们进一步引入了左右一致性约束作为扩散过程的分类器引导。我们的框架结合了近期先进的基于学习的方法和来自传统立体视觉的几何约束。为了训练模型,我们创建了一个包含多样化透明和镜面物体的大型场景级合成数据集,以弥补现有桌面数据集的不足。训练后的模型可直接应用于现实世界的自然场景,并在多个公共深度估计基准中取得了 SOTA 的性能。在真实环境中的进一步实验表明,准确的深度预测显著提升了各种场景下的机器人操作能力。

关键词

引用

@article{arxiv.2409.14365,
  title  = {D3RoMa: Disparity Diffusion-based Depth Sensing for Material-Agnostic Robotic Manipulation},
  author = {Songlin Wei and Haoran Geng and Jiayi Chen and Congyue Deng and Wenbo Cui and Chengyang Zhao and Xiaomeng Fang and Leonidas Guibas and He Wang},
  journal= {arXiv preprint arXiv:2409.14365},
  year   = {2024}
}