ProFuse:面向开放词汇3D高斯泼溅的高效跨视图上下文融合
计算机视觉与模式识别
2026-01-21 v2
摘要
我们提出了ProFuse,一个用于基于3D高斯泼溅(3DGS)的开放词汇3D场景理解的高效上下文感知框架。该流程在直接配准设置中增强了跨视图一致性和掩膜内聚性,仅增加极少的开销且无需渲染监督的微调。我们不依赖预训练的3DGS场景,而是引入了一个密集对应引导的预配准阶段,该阶段以精确的几何初始化高斯,同时通过跨视图聚类构建3D上下文提议。每个提议携带一个通过成员嵌入加权聚合获得的全局特征,该特征在直接配准过程中融合到高斯上,以保持跨视图的逐基元语言一致性。由于关联是预先建立的,语义融合除了标准重建外不需要额外优化,并且模型在不进行致密化的情况下保持几何细化。ProFuse实现了强大的开放词汇3DGS理解,同时每个场景约五分钟即可完成语义附着,比SOTA快两倍。更多详情请访问我们的项目页面 https://chiou1203.github.io/ProFuse/。
引用
@article{arxiv.2601.04754,
title = {ProFuse: Efficient Cross-View Context Fusion for Open-Vocabulary 3D Gaussian Splatting},
author = {Yen-Jen Chiou and Wei-Tse Cheng and Yuan-Fu Yang},
journal= {arXiv preprint arXiv:2601.04754},
year = {2026}
}
备注
10 pages, 5 figures