中文

多模态 3D 占据 grounding 的粗到细方法

计算机视觉与模式识别 2025-09-04 v2 机器人学

摘要

视觉 grounding 旨在基于自然语言描述识别场景中对象或区域,这对于具有空间感知能力的自动驾驶至关重要。然而,现有的视觉 grounding 任务通常依赖于边界框,往往难以捕捉细粒度细节。边界框内并非所有体素都被占据,导致对象表示不准确。为此,我们引入了一个针对具有挑战性户外场景的 3D 占据 grounding 基准数据集。该数据集基于 nuScenes 数据集,集成了自然语言与体素级占据注释,相较于传统 grounding 任务提供了更精确的对象感知。此外,我们提出了 GroundingOcc,一个用于 3D 占据 grounding 的 end-to-end 模型,通过多模态学习实现从粗到细的预测。具体而言,GroundingOcc 包含用于特征提取的多模态编码器、用于体素级预测的占据头部以及用于细化定位的 grounding 头部。此外,一个 2D grounding 模块和一个深度估计模块增强了几何理解,从而提升了模型性能。在该基准数据集上的大量实验表明,我们的方法在 3D 占据 grounding 任务上优于现有基线。该数据集可在 https://github.com/RONINGOD/GroundingOcc 上获取。

关键词

引用

@article{arxiv.2508.01197,
  title  = {A Coarse-to-Fine Approach to Multi-Modality 3D Occupancy Grounding},
  author = {Zhan Shi and Song Wang and Junbo Chen and Jianke Zhu},
  journal= {arXiv preprint arXiv:2508.01197},
  year   = {2025}
}