MetricAnything:基于噪声异构来源的度量深度预训练扩展
计算机视觉与模式识别
2026-01-30 v1 人工智能
摘要
规模化推动了最近视觉基础模型的进展,但将这一范式扩展到度量深度估计仍具有挑战性,due to 异构传感器噪声、相机依赖偏差以及噪声跨源3D数据的度量模糊。我们引入MetricAnything,一个简单且可扩展的预训练框架,从噪声、多样化的3D来源学习度量深度,而无需手动设计的提示、相机特定建模或任务特定体系结构。我们方法的核心是稀疏度量提示,通过随机遮蔽深度图创建,作为一种通用接口,解耦空间推理与传感器和相机偏差。使用约2000万图像深度对,覆盖重建、捕获和渲染的3D数据,跨10000个相机模型,我们首次展示了度量深度轨道明确的规模趋势。预训练模型在深度完成、超分辨率和雷达-摄像机融合等提示驱动任务中表现出色,而其蒸馏的无提示学生在单目深度估计、相机内参恢复、单/多视角度量3D 重建和 VLA 规划中实现最先进的结果。我们还展示了将MetricAnything预训练的ViT用作视觉编码器,显著提升了多模态大语言模型在空间智能方面的能力。这一结果表明,度量深度估计可以从驱动现代基础模型的相同规模规律中受益,为通往可扩展且高效的真实世界度量感知新路径。我们开源MetricAnything于http://metric-anything.github.io/metric-anything-io/以支持社区研究。
引用
@article{arxiv.2601.22054,
title = {MetricAnything: Scaling Metric Depth Pretraining with Noisy Heterogeneous Sources},
author = {Baorui Ma and Jiahui Yang and Donglin Di and Xuancheng Zhang and Jianxun Cui and Hao Li and Yan Xie and Wei Chen},
journal= {arXiv preprint arXiv:2601.22054},
year = {2026}
}
备注
Project Page: https://metric-anything.github.io/metric-anything-io/