3D视觉语言高斯溅射
计算机视觉与模式识别
2025-05-06 v2
摘要
近期在3D重建方法和视觉语言模型方面的进展推动了多模态3D场景理解的发展,这在机器人、自动驾驶和虚拟/增强现实等领域具有至关重要的应用。然而,现有的多模态场景理解方法往往 naively 将语义表示嵌入3D重建方法,未能在视觉和语言模态之间取得满意的平衡,导致对半透明或反射性物体的语义光栅化效果不佳,并对颜色模态过拟合。为缓解这些限制,我们提出一种解决方案,充分处理视觉和语义模态的差异,即一种用于场景理解的3D视觉语言高斯溅射模型,强调语言模态的表征学习。我们提出了一种新型跨模态光栅化器,通过模态融合和平滑语义指示器来增强语义光栅化。我们还采用相机视图融合技术,以提高现有与合成视图之间的语义一致性,从而有效缓解了过拟合问题。广泛的实验表明,我们的方法在开放词汇语义分割方面实现了拔得头筹的性能,显著优于现有方法。
引用
@article{arxiv.2410.07577,
title = {3D Vision-Language Gaussian Splatting},
author = {Qucheng Peng and Benjamin Planche and Zhongpai Gao and Meng Zheng and Anwesa Choudhuri and Terrence Chen and Chen Chen and Ziyan Wu},
journal= {arXiv preprint arXiv:2410.07577},
year = {2025}
}
备注
Accepted at ICLR 2025. Main paper + supplementary material