中文

利用自动 CAD 注释实现 3D 场景理解的监督学习

计算机视觉与模式识别 2025-05-19 v4

摘要

高层次的 3D 场景理解是许多应用的关键,但生成准确的 3D 注释的挑战使得开发深度学习模型困难。我们转向最近在自动检索合成 CAD 模型方面的进展,展示了由此类方法生成的数据可作为训练监督深度学习模型的高质量真实参考。更确切地说,我们采用了之前用于自动为 ScanNet 场景中的对象标注其 9D 位姿和 CAD 模型的管道。本次实验应用在最近缺乏此类注释的 ScanNet++ v1 数据集上。我们的发现表明,不仅可以基于这些自动获取的注释训练深度学习模型,而且使用这些注释训练的模型还能超越在人工标注数据上训练的模型。我们在两个不同的任务上进行了验证:点云完成和单视图 CAD 模型检索和对齐。我们的結果凸显了自动 3D 注释在提升模型性能的同时显著降低注释成本的潜力。为支持未来的 3D 场景理解研究,我们将发布我们的注释,称为 SCANnotate++,以及我们训练的模型。

关键词

引用

@article{arxiv.2504.13580,
  title  = {Leveraging Automatic CAD Annotations for Supervised Learning in 3D Scene Understanding},
  author = {Yuchen Rao and Stefan Ainetter and Sinisa Stekovic and Vincent Lepetit and Friedrich Fraundorfer},
  journal= {arXiv preprint arXiv:2504.13580},
  year   = {2025}
}

备注

Project page: https://stefan-ainetter.github.io/SCANnotatepp; CVPR'25 Workshop