中文

OpenInsGaussian:基于上下文感知跨视图融合的开放词汇实例高斯分割

计算机视觉与模式识别 2025-10-22 v1

摘要

理解 3D 场景是 autonomous driving、机器人和增强现实领域的关键任务。最近的语义高斯光束方法利用大规模 2D 视觉模型将 2D 语义特征投影到 3D 场景中。然而,这些方法存在两个主要局限性:(1) 前处理阶段对于单个掩码的上下文线索不足,(2) 融合来自这些 2D 模型的多视角特征时存在不一致性和信息缺失。本文提出了 \textbf{OpenInsGaussian},一种具有上下文感知跨视图融合的 \textbf{Open}-vocabulary \textbf{Ins}tance \textbf{Gaussian} 分割框架。我们的方法由两个模块组成:上下文感知特征提取模块,通过丰富的语义上下文增强每个掩码;注意力驱动特征聚合模块,以选择性融合多视角特征,以缓解对齐误差和不完整性。通过在基准数据集上的大量实验,OpenInsGaussian 在开放词汇 3D 高斯分割中实现了 state-of-the-art 成绩,显著优于现有基线。这些发现凸显了我们所提出方法的鲁棒性和通用性,标志着 3D 场景理解及其在多样真实场景中实际部署的重要进步。

关键词

引用

@article{arxiv.2510.18253,
  title  = {OpenInsGaussian: Open-vocabulary Instance Gaussian Segmentation with Context-aware Cross-view Fusion},
  author = {Tianyu Huang and Runnan Chen and Dongting Hu and Fengming Huang and Mingming Gong and Tongliang Liu},
  journal= {arXiv preprint arXiv:2510.18253},
  year   = {2025}
}