LightSplat:五秒内实现快速高效的开放词汇3D场景理解
计算机视觉与模式识别
2026-03-26 v1
摘要
开放词汇3D场景理解使用户能够通过自然语言在复杂3D环境中对新颖物体进行分割。然而,现有方法由于迭代优化和稠密的高斯特征分配,导致运行缓慢、占用内存过多且过于复杂。为此,我们提出了LightSplat——一个无需训练、快速且内存高效的框架,通过注入到多视角图像的3D表示中,仅为2字节的语义索引。我们仅为显著区域分配语义索引,并通过轻量级的索引-特征映射进行管理,从而消除了昂贵的特征优化和存储开销。进一步通过单步聚类确保语义一致性和高效推理,该聚类将在3D中与几何和语义相关的掩码进行链接。我们在LERF-OVS、ScanNet和DL3DV-OVS上进行评估,覆盖复杂的室内外场景。结果表明,LightSplat以最高可达50-400倍的加速和64倍的内存降低实现了最先进的性能,实现了可扩展的语言驱动3D理解。详情请访问我们的项目页面 https://vision3d-lab.github.io/lightsplat/。
引用
@article{arxiv.2603.24146,
title = {LightSplat: Fast and Memory-Efficient Open-Vocabulary 3D Scene Understanding in Five Seconds},
author = {Jaehun Bang and Jinhyeok Kim and Minji Kim and Seungheon Jeong and Kyungdon Joo},
journal= {arXiv preprint arXiv:2603.24146},
year = {2026}
}
备注
Accepted to CVPR 2026