中文

YouTube-Occ:从YouTube视频中学习室内3D语义占据预测

计算机视觉与模式识别 2025-06-24 v1

摘要

过去,3D语义占据预测被认为需要精确的几何关系才能实现有效训练。然而,在复杂的室内环境中,大规模数据收集和细粒度标注的必要性由于数据获取 setup的复杂性和隐私 concerns而变得不切实际。本文展示了仅使用室内互联网数据即可实现3D空间精确训练,无需任何针对内在或外在参数的预先知识。我们收集了一个网络数据集YouTube-Occ,包含来自YouTube的住宅导览视频,为3D表示学习提供了丰富的真实住宅场景。基于该网络数据集,我们建立了一个完全自监督的模型,利用可获得的2D先验知识实现强大的3D室内感知。具体而言,我们利用繁荣的视觉基础模型的优势,通过将相似像素分组为超像素来将2D区域级知识蒸馏到占据网络中。实验结果表明,我们的方法在两个流行基准(NYUv2和OccScanNet)上实现了零样本性能的最先进水平。

关键词

引用

@article{arxiv.2506.18266,
  title  = {YouTube-Occ: Learning Indoor 3D Semantic Occupancy Prediction from YouTube Videos},
  author = {Haoming Chen and Lichen Yuan and TianFang Sun and Jingyu Gong and Xin Tan and Zhizhong Zhang and Yuan Xie},
  journal= {arXiv preprint arXiv:2506.18266},
  year   = {2025}
}