语言为先验,视觉为校准:单目深度估计的度量尺度恢复
计算机视觉与模式识别
2026-01-12 v3
摘要
相对深度基础模型迁移良好,但单目度量深度仍是 Ill-posed 的问题,由于不可辨识的全局尺度以及对域迁移的敏感性。我们在冻结骨干网络的校准设置下,通过逆深度中的图像特定仿射变换恢复度量深度,仅训练轻量级校准头部,同时保持相对深度骨干网络和CLIP文本编码器固定。由于标题提供的粗糙但噪声较大的尺度线索因措辞和遗漏对象而有所不同,我们使用语言预测不确定性感知的包络,界定可行校准参数的范围,而非仅依赖文本预测的点估计。随后,我们利用汇聚的多尺度冻结视觉特征在该包络内选择图像特定的校准。训练时,逆深度中的闭式最小二乘准则为学习包络和所选校准提供逐图像监督。实验在NYUv2和KITTI上提升了同域精度,而对SUN-RGBD和DDAD的零样本迁移显示出对强大语言-仅基线的改进鲁棒性。
引用
@article{arxiv.2601.01457,
title = {Language as Prior, Vision as Calibration: Metric Scale Recovery for Monocular Depth Estimation},
author = {Mingxia Zhan and Li Zhang and Beibei Wang and Yingjie Wang and Zenglin Shi},
journal= {arXiv preprint arXiv:2601.01457},
year = {2026}
}