中文

SplatTalk: 基于高斯泼溅的 3D 视觉问答

计算机视觉与模式识别 2025-08-05 v2

摘要

语言引导的 3D 场景理解对于推进机器人、AR/VR 和人机交互领域的应用至关重要,它使模型能够通过自然语言理解 3D 环境并与之交互。尽管 2D 视觉语言模型 (VLMs) 在 2D 视觉问答 (VQA) 任务中取得了显著成功,但由于 3D 数据的复杂性和人工标注的高昂成本,3D 领域的进展明显缓慢。在本研究中,我们提出了 SplatTalk,一种使用可泛化 3D 高斯泼溅 (3DGS) 框架生成 3D token 的新方法,这些 token 可直接输入到预训练的 LLM 中,从而实现对仅包含位姿图像的场景的有效零样本 3D 视觉问答 (3D VQA)。在多个基准上的实验表明,我们的方法优于专门为该任务训练的 3D 模型以及仅利用图像(我们的设定)的先前基于 2D-LMM 的模型,同时与额外利用 3D 输入的 SOTA 3D LMM 取得了具有竞争力的性能。项目网站:https://splat-talk.github.io/

关键词

引用

@article{arxiv.2503.06271,
  title  = {SplatTalk: 3D VQA with Gaussian Splatting},
  author = {Anh Thai and Songyou Peng and Kyle Genova and Leonidas Guibas and Thomas Funkhouser},
  journal= {arXiv preprint arXiv:2503.06271},
  year   = {2025}
}

备注

Accepted at ICCV 2025