基于连续标记扩散的分形自回归深度估计
计算机视觉与模式识别
2026-03-17 v1
摘要
单目深度估计可从自回归(AR)生成中受益,但直接 AR 模型受限于 RGB 与深度之间的模态差距、像素级生成效率低以及连续深度预测不稳定。我们提出一种分形视觉自回归扩散框架,将深度估计重新表述为粗到细的、下一个尺度的自回归生成过程。VCFR 模块融合多尺度图像特征与当前深度预测,以提高跨模态条件。条件去噪扩散损失直接在连续空间中建模深度分布,缓解离散量化导致的误差。为提升计算效率,我们将尺度级生成器组织成分形递归架构,在自相似层次结构中重复使用基础视觉 AR 单元。我们进一步引入不确定性感知的鲁棒共识聚合方案,用于多采样推理以提高融合稳定性并提供实用的像素级可靠性估计。在标准基准数据集上的实验表明,所提方法表现优异,验证了所提设计的有效性。
引用
@article{arxiv.2603.14702,
title = {Fractal Autoregressive Depth Estimation with Continuous Token Diffusion},
author = {Jinchang Zhang and Xinrou Kang and Guoyu Lu},
journal= {arXiv preprint arXiv:2603.14702},
year = {2026}
}