无 3D 扫描的 3D:基于视频生成点云的可扩展预训练
计算机视觉与模式识别
2026-03-27 v2
摘要
尽管 3D 自监督学习近期取得进展,但收集大规模 3D 场景扫描仍然昂贵且费时。在本工作中,我们研究是否可以从在没有任何真实 3D 传感器的情况下记录的无标注视频中学习 3D 表征。我们提出了结合 Sinkhorn-Knopp 的拉普拉斯感知多级 3D 聚类(LAM3C),这是一个从由无标注视频重建的视频生成点云中学习的自监督框架。我们首先引入 RoomTours,这是一个视频生成点云数据集,通过从网络收集房间漫游视频(例如房地产导览)并使用现成的正向重建模型生成 49,219 个场景构建而成。我们还提出了一种噪声正则化损失,通过强制局部几何平滑性并确保在噪声点云下的特征稳定性来稳定表征学习。值得注意的是,在未使用任何真实 3D 扫描的情况下,LAM3C 在室内语义与实例分割上的性能优于以往的自监督方法。这些结果表明,无标注视频是 3D 自监督学习的丰富数据源。我们的源代码可在 https://ryosuke-yamada.github.io/lam3c/ 获取。
引用
@article{arxiv.2512.23042,
title = {3D sans 3D Scans: Scalable Pre-training from Video-Generated Point Clouds},
author = {Ryousuke Yamada and Kohsuke Ide and Yoshihiro Fukuhara and Hirokatsu Kataoka and Gilles Puy and Andrei Bursuc and Yuki M. Asano},
journal= {arXiv preprint arXiv:2512.23042},
year = {2026}
}
备注
Accepted to CVPR 2026. Project page: https://ryosuke-yamada.github.io/lam3c/