Scal3R:大规模 3D 重建的可扩展测试时训练
计算机视觉与模式识别
2026-04-10 v1
摘要
本文解决了从长视频序列进行大规模 3D 场景重建的任务。最近的前馈重建模型通过直接从 RGB 图像回归 3D 几何,无需显式的 3D 先验或几何约束,取得了令人鼓舞的成果。然而,这些方法常常因记忆容量有限且无法有效捕获全局语境线索,在长序列上难以维持重建精度和一致性。相比之下,人类能够自然地利用全局场景理解来指导局部感知。鼓舞于此,我们提出了一种新型的神经全局上下文表示,高效压缩并保留长程场景信息,使模型能够利用广泛的上下文线索以实现更高的重建精度和一致性。该上下文表示通过一组在测试时通过自监督目标快速适应的轻量级神经子网络实现,显著提升了记忆容量,却未引入显著的计算开销。在包括 KITTI Odometry~\cite{Geiger2012CVPR} 和 Oxford Spires~\cite{tao2025spires} 数据集在内的多个大规模基准实验表明,我们的方法在处理超大场景方面有效,实现了领先的姿态精度和最先进的 3D 重建精度,同时保持了效率。代码已公开:https://zju3dv.github.io/scal3r。
引用
@article{arxiv.2604.08542,
title = {Scal3R: Scalable Test-Time Training for Large-Scale 3D Reconstruction},
author = {Tao Xie and Peishan Yang and Yudong Jin and Yingfeng Cai and Wei Yin and Weiqiang Ren and Qian Zhang and Wei Hua and Sida Peng and Xiaoyang Guo and Xiaowei Zhou},
journal= {arXiv preprint arXiv:2604.08542},
year = {2026}
}
备注
Project page: https://zju3dv.github.io/scal3r