基于自监督 ViT 特征和单目基础模型的高度完成测试时适应
计算机视觉与模式识别
2026-04-03 v1
摘要
准确的数字表面模型 (DSM) 对许多地理空间应用至关重要,包括城市监测、环境分析、基础设施管理和变化检测。然而,大规模 DSM 经常包含不完整或过时的区域 due to 采集限制、重建痕迹或建筑环境的变化。传统的高度完成方法主要依赖于空间插值或假设空间连续性,从而在对象缺失时失败。最近的基于学习的方法改善了重建质量,但通常需要针对传感器特定数据集进行监督训练,限制了其跨 domain 和感知条件的泛化能力。我们提出了 Prior2DSM,一个完全在测试时运行的 metric DSM 完成框架,完全依赖 foundation 模型。与需要 task-specific 训练的先前高度完成方法不同,本方法结合了 DINOv3 的自监督 Vision Transformer (ViT) 特征与单目深度 foundation 模型,通过语义特征空间对应的信息传播不完整的高度先验。测试时适应 (TTA) 使用参数高效的低秩适应 (LoRA) 结合轻量级多层感知机 (MLP),预测空间变动的 scale 和 shift 参数,将相对深度估计转换为 metric 高度。实验表明,该方法在插值方法、基于先验的尺度重排序高度方法以及最先进的单目深度估计模型方面 consistently 获得改进。Prior2DSM 在保持结构忠诚度的同时降低了重建误差,较线性拟合 MDE 的 RMSE 最多降低 46%,并且进一步实现了 DSM 更新和耦合 RGB-DSM 生成。
引用
@article{arxiv.2604.02009,
title = {Test-Time Adaptation for Height Completion via Self-Supervised ViT Features and Monocular Foundation Models},
author = {Osher Rafaeli and Tal Svoray and Ariel Nahlieli},
journal= {arXiv preprint arXiv:2604.02009},
year = {2026}
}