中文

通过自监督自适应从视觉基础模型学习零样本占据网络

计算机视觉与模式识别 2025-03-11 v1

摘要

由于3D标注的费时费力性,从2D单目图像估计3D世界是一项基础且具挑战性的任务。为了简化标签获取,本文提出了一种新方法,通过将3D监督解耦为图像级基元(例如语义和几何分量)的集合,将2D视觉基础模型(VFMs)与3D任务联系起来。作为关键动机,我们利用视觉语言模型的零样本能力来获取图像语义。然而,由于著名的病态问题——多个不同的3D场景可以产生相同的2D投影,以零样本方式直接从单目图像推断度量深度是不合适的。相比之下,2D VFMs提供了有前景的相对深度来源,在经过适当的缩放和偏移后,理论上与度量深度一致。因此,我们利用时间一致性(也称为新视角合成)优化缩放和偏移,将源自VFMs的相对深度自适应转换为度量深度,且无需获取真实度量深度。随后,我们利用重建的度量深度将语义投影到3D空间,从而提供3D监督。在nuScenes和SemanticKITTI上的大量实验证明了我们框架的有效性。例如,在nuScenes的体素占据预测任务上,所提方法以3.34%的mIoU超越了当前SOTA。

关键词

引用

@article{arxiv.2503.07125,
  title  = {Learning A Zero-shot Occupancy Network from Vision Foundation Models via Self-supervised Adaptation},
  author = {Sihao Lin and Daqi Liu and Ruochong Fu and Dongrui Liu and Andy Song and Hongwei Xie and Zhihui Li and Bing Wang and Xiaojun Chang},
  journal= {arXiv preprint arXiv:2503.07125},
  year   = {2025}
}

备注

preprint