中文

OpenVoxel:面向开放词汇3D场景理解的免训练体素分组与描述

计算机视觉与模式识别 2026-01-15 v1

摘要

我们提出了OpenVoxel,这是一种免训练算法,用于对稀疏体素进行分组和描述,以完成开放词汇3D场景理解任务。给定从3D场景的多视图图像获得的稀疏体素光栅化(SVR)模型,我们的OpenVoxel能够生成描述场景中不同对象的有意义的分组。此外,通过利用强大的视觉语言模型(VLM)和多模态大语言模型(MLLM),我们的OpenVoxel通过对每个分组进行描述,成功构建了一个信息丰富的场景图,从而支持进一步的3D场景理解任务,如开放词汇分割(OVS)或指代表达分割(RES)。与先前的方法不同,我们的方法是免训练的,并且不引入来自CLIP/BERT文本编码器的嵌入。相反,我们直接使用MLLM进行文本到文本的搜索。通过广泛的实验,我们的方法在性能上优于近期研究,尤其是在复杂的指代表达分割(RES)任务中。代码将开源。

关键词

引用

@article{arxiv.2601.09575,
  title  = {OpenVoxel: Training-Free Grouping and Captioning Voxels for Open-Vocabulary 3D Scene Understanding},
  author = {Sheng-Yu Huang and Jaesung Choe and Yu-Chiang Frank Wang and Cheng Sun},
  journal= {arXiv preprint arXiv:2601.09575},
  year   = {2026}
}

备注

project page: https://peterjohnsonhuang.github.io/openvoxel-pages/