语义提示扩散转换器实现像素级完美深度
计算机视觉与模式识别
2025-10-30 v2
摘要
本文提出 Pixel-Perfect Depth,即一种基于像素空间扩散生成的单目深度估计模型,能够产生高质量、无飞行像素的点云。当前的生成式深度估计模型通过微调稳定扩散实现了令人瞩目的性能。然而,这些模型需要 VAE 将深度图压缩到潜在空间,这不可避免地在边缘和细节处引入“飞行像素”。我们的模型通过直接在像素空间进行扩散生成,规避了 VAE 引起的瑕疵。为克服像素空间生成的高复杂度,我们引入两种新颖设计:1)语义提示扩散转换器(SP-DiT),将来自视觉基础模型的语义表示纳入 DiT,以提示扩散过程,从而保持全局语义一致性并增强细粒度视觉细节;2)级联 DiT 设计,通过逐步增加标记数量来进一步提升效率和准确性。我们的模型在五个基准测试中实现了所有已发布生成模型的最佳性能,在边缘感知点云评估中也显著超越其他所有模型。
引用
@article{arxiv.2510.07316,
title = {Pixel-Perfect Depth with Semantics-Prompted Diffusion Transformers},
author = {Gangwei Xu and Haotong Lin and Hongcheng Luo and Xianqi Wang and Jingfeng Yao and Lianghui Zhu and Yuechuan Pu and Cheng Chi and Haiyang Sun and Bing Wang and Guang Chen and Hangjun Ye and Sida Peng and Xin Yang},
journal= {arXiv preprint arXiv:2510.07316},
year = {2025}
}
备注
NeurIPS 2025. Project page: https://pixel-perfect-depth.github.io/