GlobalSplat:基于全局场景记忆的高效前馈 3D 高斯溅写
计算机视觉与模式识别
2026-04-20 v2
摘要
原始素材的高效空间分配是 3D 高斯溅写的基础,直接决定了表示紧凑性、重建速度和渲染保真度之间的协同作用。以往的解决方案——无论是基于迭代优化还是基于前馈推断——都在这些目标之间存在显著的权衡,主要由于依赖基于局部、以启发式方式驱动的分配策略,这些策略缺乏全局场景 awareness。具体而言,当前的前馈方法大多是像素对齐或体素对齐。通过将像素反投影到密集、面向视图的原始素材中,它们将冗余性烘焙到 3D 资产中。随着输入视角数的增加,表征规模也随之增大,全局一致性变得脆弱。为此,我们引入 GlobalSplat,一个基于“先对齐后解码”原则构建的框架。我们的做法学习一个紧凑的、全局的、潜在的场景表示,该表示编码多视图输入并在解码任何显式 3D 几何之前解决跨视图对应关系。关键在于,这种表述使我们能够在不依赖预训练的像素预测 backbones 或重复使用来自稠密基线的潜在特征的情况下,实现紧凑、全局一致的重建。在一个由粗到细训练 curriculum 实现的框架下,GlobalSplat 在逐渐增加解码容量的过程中自然地防止了表示膨胀。在 RealEstate10K 和 ACID 数据集上,我们的模型在保持竞争的 novel-view synthesis 性能的同时,使用仅 16K 个高斯即可,显著少于稠密管道所需,实现轻盈的 4MB 存储 footprint。进一步地,GlobalSplat 比基线模型实现了显著更快的推理速度,在单次前向传递中运行时间低于 78 毫秒。项目页面可在 https://r-itk.github.io/globalsplat/ 查看。
引用
@article{arxiv.2604.15284,
title = {GlobalSplat: Efficient Feed-Forward 3D Gaussian Splatting via Global Scene Tokens},
author = {Roni Itkin and Noam Issachar and Yehonatan Keypur and Xingyu Chen and Anpei Chen and Sagie Benaim},
journal= {arXiv preprint arXiv:2604.15284},
year = {2026}
}