NuGrounding:面向自动驾驶的多视角 3D 视觉 grounding 框架
计算机视觉与模式识别
2025-05-27 v2
摘要
多视角 3D 视觉 grounding 对自动驾驶车辆解释自然语言并在复杂环境中定位目标对象至关重要。然而,现有数据集和方法受限于粗糙的语言指令,以及 3D 几何推理与语言理解的集成不足。为此,我们引入 NuGrounding,首个面向自动驾驶的大规模多视角 3D 视觉 grounding 数据集。我们提出 Grounding 层次结构 (HoG) 方法,用于构建 NuGrounding,生成分层多级指令,确保对人类指令模式的全面覆盖。为应对这一挑战性数据集,我们提出一种新范式,将多模态大语言模型 (MLLM) 的指令理解能力与专家检测模型的精确定位能力无缝融合。该方法引入两个解耦任务 token 和一个上下文查询,用于聚合 3D 几何信息和语义指令,随后通过融合解码器细化空间-语义特征融合,以实现精确定位。广泛实验表明,我们的方法相较于从代表性 3D 场景理解方法迁移的基线方法性能显著提升,分别在精度和召回率上达到 0.59 和 0.64,改进幅度分别为 50.8% 和 54.7%。
引用
@article{arxiv.2503.22436,
title = {NuGrounding: A Multi-View 3D Visual Grounding Framework in Autonomous Driving},
author = {Fuhao Li and Huan Jin and Bin Gao and Liaoyuan Fan and Lihui Jiang and Long Zeng},
journal= {arXiv preprint arXiv:2503.22436},
year = {2025}
}