中文

VFM-Recon:利用尺度对齐基础先验实现跨域场景级神经重建

计算机视觉与模式识别 2026-03-16 v1

摘要

单目视频的场景级神经体积重建在严重域迁移下仍具有挑战性。尽管近期进展在视觉基础模型(VFMs)提供了来自大规模数据的可迁移通用先验,但其尺度模糊的预测与体积融合所需的尺度一致性不兼容。为解决此差距,我们提出了VFMRecon,将可迁移VFM先验与尺度一致性要求在场景级神经重建中相结合。具体而言,我们首先引入轻量级尺度对齐阶段以恢复多视图尺度一致性。随后,我们通过轻量级任务特定适配器将预训练VFM特征集成到神经体积重建管道中,这些适配器在重建期间进行训练,同时保持预训练表示的跨域鲁棒性。我们在ScanNet train split 上进行训练,并在 both in-distribution ScanNet test split 和 out-of-distribution TUM RGB-D和Tanks and Temples数据集上进行评估。结果表明,我们的模型在所有数据集域上实现了最先进的性能。特别是在具有挑战性的户外Tanks and Temples数据集上,我们的模型在重建网格评估中实现了70.1的F1分数,显著优于最近最强的竞争者VGGT,该模型仅达到51.8。

关键词

引用

@article{arxiv.2603.12657,
  title  = {VFM-Recon: Unlocking Cross-Domain Scene-Level Neural Reconstruction with Scale-Aligned Foundation Priors},
  author = {Yuhang Ming and Tingkang Xi and Xingrui Yang and Lixin Yang and Yong Peng and Cewu Lu and Wanzeng Kong},
  journal= {arXiv preprint arXiv:2603.12657},
  year   = {2026}
}

备注

19 pages, 5 figures, 4 tables