RemixFusion:基于残差的大规模在线RGB-D重建的混合表示
计算机视觉与模式识别
2025-09-16 v3
摘要
神经隐式表示的引入显著推动了在线稠密重建技术的发展。相较于传统的显式表示方法(如 TSDF),其在映射完整性和内存效率方面具有优势。然而,缺乏重建细节以及神经表示学习耗时的瓶颈,阻碍了基于神经的方法在大规模在线重建中的广泛应用。我们提出了 RemixFusion,这是一种专为高质量和大规模在线RGB-D重建而设计的基于残差的混合表示,同时用于场景重建和相机姿态估计。具体而言,我们提出了由显式粗糙 TSDF 网格和产生表示细节粗糙网格上残差的隐式神经模块组成的基于残差的地图表示。这种混合表示允许在受限的时间和内存预算下实现细节丰富的重建,与基于纯隐式表示产生的过度平滑结果形成鲜明对比,从而为高质量的相机跟踪铺平了道路。此外,我们将残差表示扩展至通过束积调整 (BA) 处理多帧联合姿态优化。与现有方法不同,后者直接优化姿态,而我们选择优化姿态变化。结合一种新颖的自适应梯度放大技术,我们的方法在优化收敛性和全局最优性方面取得了更好的表现。此外,我们采用局部移动体积,通过分治设计对混合场景表示进行因式分解,以便在残差框架中实现高效的在线学习。广泛的实验结果表明,我们的方法在大规模场景的映射和跟踪精度方面,均优于所有最先进的基于显式或隐式表示的方法。
引用
@article{arxiv.2507.17594,
title = {RemixFusion: Residual-based Mixed Representation for Large-scale Online RGB-D Reconstruction},
author = {Yuqing Lan and Chenyang Zhu and Shuaifeng Zhi and Jiazhao Zhang and Zhoufeng Wang and Renjiao Yi and Yijie Wang and Kai Xu},
journal= {arXiv preprint arXiv:2507.17594},
year = {2025}
}
备注
project page: https://lanlan96.github.io/RemixFusion/