中文

SaLon3R:面向结构感知的长期通用 3D 重建从未对准图像

计算机视觉与模式识别 2025-10-20 v1

摘要

最近的 3D 高斯光束(3DGS)技术实现了从序列输入视图进行的通用、即时重建。然而,现有方法通常预测每个像素的高斯并将所有视图的高斯组合作为场景表示,导致在持续视频序列中出现显著的冗余和几何不一致性。为此,我们提出了 SaLon3R,一种面向结构感知的长期 3DGS 重建框架。据我们所知,SaLon3R 是首个能够在 10 FPS 以上的速度上重建 50 多个视图的在线通用 GS 方法,实现 50%-90% 的冗余消除。我们的方法引入紧凑锚定原语,通过可微分的显著性感知高斯量化消除冗余,配合 3D Point Transformer 来细化锚定属性和显著性,从而解决跨帧的几何和光度不一致性。具体而言,我们首先利用 3D 重建主干网络预测稠密的 per-pixel 高斯和显著性图,编码区域几何复杂度。随后将冗余高斯压缩为紧凑锚定,通过优先高复杂度区域实现。3D Point Transformer 然后从训练数据中学习 3D 空间中的空间结构先验,用于细化锚定属性和显著性,实现区域自适应高斯解码以保证几何保真度。在未知相机参数且无需测试时优化的情况下,我们的方法在单个前向传递中有效解决了瑕疵并修剪冗余 3DGS。实验在多个数据集上表明,我们在 novel view synthesis 和深度估计方面实现了最先进的性能,展现出卓越的效率、鲁棒性和广泛性,用于长期通用 3D 重建。项目页面:https://wrld.github.io/SaLon3R/。

关键词

引用

@article{arxiv.2510.15072,
  title  = {SaLon3R: Structure-aware Long-term Generalizable 3D Reconstruction from Unposed Images},
  author = {Jiaxin Guo and Tongfan Guan and Wenzhen Dong and Wenzhao Zheng and Wenting Wang and Yue Wang and Yeung Yam and Yun-Hui Liu},
  journal= {arXiv preprint arXiv:2510.15072},
  year   = {2025}
}