中文

AGO:用于开放世界3D占据预测的自适应 grounding

计算机视觉与模式识别 2025-11-11 v2

摘要

开放世界3D语义占据预测旨在从传感器输入生成体素化3D表示,同时识别已知和未知对象。将开放词汇知识从视觉-语言模型(VLM)传递到实际应用是一个有前景的方向,但仍面临挑战。然而,基于VLM派生的2D伪标签与传统监督方法受限于预定义的标签空间,缺乏通用预测能力。直接对齐预训练的图像嵌入,另一方面,往往难以实现可靠的性能,因为VLm中图像和文本表示不一致。为此,我们提出了AGO,一个具有自适应grounding以处理多样化开放世界情景的3D占据预测框架。AGO首先对周围图像和类提示进行编码,分别生成3D嵌入和文本嵌入,利用基于相似度的grounding训练和3D伪标签。此外,一个模态适配器将3D嵌入映射到与VLM派生的图像嵌入对齐的空间,减少模态间隙。在Occ3D-nuScenes数据集上进行实验,AGO在零样本和少样本迁移中提高了未知对象的预测能力,同时以-state-of-the-art的闭合世界自监督性能表现,净借此前方法提高了4.09 mIoU。代码已公开:https://github.com/EdwardLeeLPZ/AGO。

关键词

引用

@article{arxiv.2504.10117,
  title  = {AGO: Adaptive Grounding for Open World 3D Occupancy Prediction},
  author = {Peizheng Li and Shuxiao Ding and You Zhou and Qingwen Zhang and Onat Inak and Larissa Triess and Niklas Hanselmann and Marius Cordts and Andreas Zell},
  journal= {arXiv preprint arXiv:2504.10117},
  year   = {2025}
}