中文

QueryOcc:基于查询的自监督 3D 语义占据学习

计算机视觉与模式识别 2025-11-24 v1 机器人学

摘要

从图像中学习 3D 场景几何和语义是计算机视觉中的核心挑战,也是自动驾驶的关键能力。由于大规模 3D 标注成本高昂,最近的研究探索了从传感器数据中直接进行无监督学习,无需手动标注。现有方法要么依赖 2D 渲染一致性,其中 3D 结构仅隐式地出现,要么依赖于来自累积激光点云的离散化体素网格,限制了空间精度和可扩展性。我们引入 QueryOcc,一种基于查询的自监督框架,通过独立采样于相邻帧之间的 4D 时空查询,直接学习连续 3D 语义占据。该框架支持来自视觉基础模型派生的伪点云或原始激光数据的监督。为实现长程监督和常数内存下的推理,我们引入一种收缩场景表示,既保留近场细节,又平滑压缩远方区域。QueryOcc 在自监督 Occ3D-nuScenes 基准测试中在语义 RayIoU 上超越了以前的基于相机的方法,实现了 11.6 FPS 的运行速度,表明直接的 4D 查询监督能够实现强大的自监督占据学习。https://research.zenseact.com/publications/queryocc/

关键词

引用

@article{arxiv.2511.17221,
  title  = {QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy},
  author = {Adam Lilja and Ji Lan and Junsheng Fu and Lars Hammarstrand},
  journal= {arXiv preprint arXiv:2511.17221},
  year   = {2025}
}