像素级完美视觉几何估计
计算机视觉与模式识别
2026-01-09 v1
摘要
从图像中恢复干净且准确的几何信息对于机器人和增强现实至关重要。然而,现有的几何基础模型仍然严重受到飞点像素和精细细节丢失的困扰。在本文中,我们提出了像素级完美视觉几何模型,该模型通过在像素空间中利用生成式建模,能够预测高质量、无飞点像素的点云。我们首先引入了 Pixel-Perfect Depth (PPD),这是一种建立在像素空间扩散 Transformer (DiT) 之上的单目深度基础模型。为了解决与像素空间扩散相关的高计算复杂度,我们提出了两个关键设计:1) 语义提示 DiT,它融合了来自视觉基础模型的语义表示来提示扩散过程,在增强细粒度视觉细节的同时保留全局语义;2) 级联 DiT 架构,它逐步增加图像 token 的数量,同时提高了效率和精度。为了进一步将 PPD 扩展到视频 (PPVD),我们引入了一种新的语义一致 DiT,它从多视图几何基础模型中提取时间一致的语义。然后,我们在 DiT 内执行参考引导的 token 传播,以最小的计算和内存开销保持时间连贯性。我们的模型在所有生成式单目和视频深度估计模型中取得了最佳性能,并产生了比所有其他模型显著更干净的点云。
引用
@article{arxiv.2601.05246,
title = {Pixel-Perfect Visual Geometry Estimation},
author = {Gangwei Xu and Haotong Lin and Hongcheng Luo and Haiyang Sun and Bing Wang and Guang Chen and Sida Peng and Hangjun Ye and Xin Yang},
journal= {arXiv preprint arXiv:2601.05246},
year = {2026}
}
备注
Code: https://github.com/gangweix/pixel-perfect-depth