迈向无歧义的空间基础模型:重新思考并解耦深度歧义
计算机视觉与模式识别
2025-03-11 v1 人工智能
机器学习
机器人学
摘要
深度歧义是空间场景理解中的一个基本挑战,尤其是在透明场景中,单一深度估计无法捕捉完整的 3D 结构。现有模型局限于确定性预测,忽略了现实世界中的多层深度。为了解决这一问题,我们引入了从单一预测到多假设空间基础模型的范式转变。我们首先提出了 \texttt{MD-3k},这是一个通过多层空间关系标签和新指标来揭示专家模型和基础模型中深度偏差的基准。为了解决深度歧义,我们提出了拉普拉斯视觉提示(LVP),这是一种免训练的频谱提示技术,通过拉普拉斯变换的 RGB 输入从预训练模型中提取隐藏深度。通过将 LVP 推断的深度与基于 RGB 的标准估计相结合,我们的方法无需模型重训练即可激发多层深度。大量实验验证了 LVP 在零样本多层深度估计中的有效性,解锁了更鲁棒、更全面的几何条件视觉生成、3D 扎根的空间推理以及时间一致的视频级深度推断。我们的基准和代码将在 https://github.com/Xiaohao-Xu/Ambiguity-in-Space 提供。
引用
@article{arxiv.2503.06014,
title = {Towards Ambiguity-Free Spatial Foundation Model: Rethinking and Decoupling Depth Ambiguity},
author = {Xiaohao Xu and Feng Xue and Xiang Li and Haowei Li and Shusheng Yang and Tianyi Zhang and Matthew Johnson-Roberson and Xiaonan Huang},
journal= {arXiv preprint arXiv:2503.06014},
year = {2025}
}
备注
32 pages, 31 figures, github repo: https://github.com/Xiaohao-Xu/Ambiguity-in-Space