高斯VLM:基于语言对齐的高斯溅射实现场景中心的 3D 视觉语言模型
计算与语言
2025-10-10 v2 机器学习
摘要
随着多模态语言模型的发展,其应用于 3D 场景理解正成为快速增长的前沿,推动了 3D 视觉语言模型(VLM)的开发。当前方法对对象检测器依赖强,引入处理瓶颈和税态灵活性的局限性。为解决这些局限性,我们提出了一种用于 3D 高斯溅射场景的场景中心 3D VLM,采用语言和任务感知的场景表示。我们的 approach 直接将丰富的语言特征嵌入 3D 场景表示中,通过将语言与每个高斯原始素子相关联,实现早期模态对齐。为处理 resulting dense representations,我们引入了 dual sparsifier,通过 task-guided 和 location-guided 路径将其蒸馏为紧凑、任务相关的标记,产生稀疏、任务感知的全局和局部场景标记。值得注意的是,我们首次提出基于高斯溅射的 VLM,利用来自标准 RGB 图像的照片逼真 3D 表示,展示了强大的泛化能力:它显著提升了先前 3D VLM 的性能,在 out-of-the-domain 设置中提升了五倍。
引用
@article{arxiv.2507.00885,
title = {Scaling Laws Are Unreliable for Downstream Tasks: A Reality Check},
author = {Nicholas Lourie and Michael Y. Hu and Kyunghyun Cho},
journal= {arXiv preprint arXiv:2507.00885},
year = {2025}
}
备注
EMNLP Findings 2025 Camera Ready