AGO:用于开放世界3D占据预测的自适应 grounding
计算机视觉与模式识别
2025-11-11 v2
摘要
开放世界3D语义占据预测旨在从传感器输入生成体素化3D表示,同时识别已知和未知对象。将开放词汇知识从视觉-语言模型(VLM)传递到实际应用是一个有前景的方向,但仍面临挑战。然而,基于VLM派生的2D伪标签与传统监督方法受限于预定义的标签空间,缺乏通用预测能力。直接对齐预训练的图像嵌入,另一方面,往往难以实现可靠的性能,因为VLm中图像和文本表示不一致。为此,我们提出了AGO,一个具有自适应grounding以处理多样化开放世界情景的3D占据预测框架。AGO首先对周围图像和类提示进行编码,分别生成3D嵌入和文本嵌入,利用基于相似度的grounding训练和3D伪标签。此外,一个模态适配器将3D嵌入映射到与VLM派生的图像嵌入对齐的空间,减少模态间隙。在Occ3D-nuScenes数据集上进行实验,AGO在零样本和少样本迁移中提高了未知对象的预测能力,同时以-state-of-the-art的闭合世界自监督性能表现,净借此前方法提高了4.09 mIoU。代码已公开:https://github.com/EdwardLeeLPZ/AGO。
引用
@article{arxiv.2504.10117,
title = {AGO: Adaptive Grounding for Open World 3D Occupancy Prediction},
author = {Peizheng Li and Shuxiao Ding and You Zhou and Qingwen Zhang and Onat Inak and Larissa Triess and Niklas Hanselmann and Marius Cordts and Andreas Zell},
journal= {arXiv preprint arXiv:2504.10117},
year = {2025}
}