中文

通过高效特征反投影学习分段式 3D 高斯实现零样本神经场景分割

计算机视觉与模式识别 2024-07-30 v4 人工智能

摘要

零样本神经场景分割无需人工标注即可重建 3D 神经分割场,是场景理解的有效途径。然而,现有模型,尤其是高效的 3D 高斯方法,难以产生紧凑的分割结果。该问题主要源于它们为各个高斯体分配的冗余可学习属性,导致对零样本生成的原始标签中的 3D 不一致性缺乏鲁棒性。为解决此问题,我们的工作——名为紧凑分段式 3D 高斯(CoSegGaussians)——提出了特征反投影与融合模块作为分割场,该模块利用一个基于高层特征、可泛化至所有高斯体的浅层解码器。具体而言,利用学习到的高斯几何参数,通过我们的反投影技术将语义感知的图像特征引入场景。提升后的特征与空间信息一起被送入多尺度聚合解码器,为所有高斯体生成分割标识。此外,我们设计了 CoSeg 损失以增强模型对 3D 不一致噪声的鲁棒性。实验结果表明,我们的模型在零样本语义分割任务上超越了基线方法,相比最佳基线提升了约 10% 的 mIoU。代码和更多结果将在 https://David-Dou.github.io/CoSegGaussians 上发布。

关键词

引用

@article{arxiv.2401.05925,
  title  = {Learning Segmented 3D Gaussians via Efficient Feature Unprojection for Zero-shot Neural Scene Segmentation},
  author = {Bin Dou and Tianyu Zhang and Zhaohui Wang and Yongjia Ma and Zejian Yuan},
  journal= {arXiv preprint arXiv:2401.05925},
  year   = {2024}
}

备注

16 pages, 9 figures, correct writing details