中文

Query3D:基于语言嵌入 3D 高斯的 LLM 驱动开放词汇场景分割

计算机视觉与模式识别 2025-01-07 v3 机器学习 机器人学

摘要

本文提出一种新颖的方法,用于自动驾驶中的开放词汇 3D 场景查询,通过将语言嵌入 3D 高斯与大型语言模型(LLM)相结合。我们提出利用 LLM 生成具有上下文规范性短语和辅助正向词,以增强分割效果和场景解释。该方法借助 GPT-3.5 Turbo 作为专家模型构建高质量文本数据集,然后用于微调较小且更高效的 LLM 以实现端侧部署。我们在 WayveScenes101 数据集上进行全面评估,结果表明 LLM 指导的分割显著优于基于预定义规范短语的传统方法。值得注意的是,经过微调的较小模型在保持更快推理速度的同时,达到了与大型专家模型相当的性能。通过消融研究,我们发现辅助正向词的有效性与模型规模相关,大型模型更擅长利用额外的语义信息。本工作代表了对更高效、具上下文感知能力的自动驾驶系统的重要进展,有效地将 3D 场景表示与高层语义查询相结合,同时保持实用部署的考量。

关键词

引用

@article{arxiv.2408.03516,
  title  = {Query3D: LLM-Powered Open-Vocabulary Scene Segmentation with Language Embedded 3D Gaussian},
  author = {Amirhosein Chahe and Lifeng Zhou},
  journal= {arXiv preprint arXiv:2408.03516},
  year   = {2025}
}