中文

RaySt3R: 预测新视角深度图以实现零样本物体补全

计算机视觉与模式识别 2025-06-06 v1

摘要

3D 形状补全广泛应用于机器人、数字孪生重建和扩展现实 (XR)。尽管近期 3D 物体与场景补全已取得令人瞩目的成果,现有方法仍缺乏 3D 一致性、计算开销大,且难以捕捉锐利的物体边界。我们的工作 (RaySt3R) 通过将 3D 形状补全重新表述为新视角合成问题来应对这些限制。具体而言,给定单张 RGB-D 图像和一个新视角(编码为一组查询光线),我们训练一个前馈 Transformer 来预测这些查询光线的深度图、物体掩码和逐像素置信度分数。RaySt3R 在多个查询视角之间融合这些预测以重建完整的 3D 形状。我们在合成和真实数据集上评估 RaySt3R,观察到它达到了最先进的性能,在所有数据集上以 3D Chamfer 距离衡量超越基线高达 44%。项目页面: https://rayst3r.github.io

关键词

引用

@article{arxiv.2506.05285,
  title  = {RaySt3R: Predicting Novel Depth Maps for Zero-Shot Object Completion},
  author = {Bardienus P. Duisterhof and Jan Oberst and Bowen Wen and Stan Birchfield and Deva Ramanan and Jeffrey Ichnowski},
  journal= {arXiv preprint arXiv:2506.05285},
  year   = {2025}
}