DepthART:单目深度估计的自回归细化任务
计算机视觉与模式识别
2025-07-01 v3
摘要
单目深度估计通过判别方法取得了显著进展,但其性能仍受限于训练数据集的局限性。虽然生成方法通过利用来自互联网规模数据集的先验知识已取得突破,近期研究表明使用微调的文本到图像扩散模型可实现最佳结果,但仍有提升空间。值得注意的是,特别是视觉自回归建模相较于扩散模型在条件图像合成方面表现更佳,同时推理时间更快。在本工作中,我们将视觉自回归 Transformer (VAR) 应用于单目深度估计问题。然而,VAR 继承的常规 GPT-2 式训练程序(教师强制)在深度估计中导致结果次优。为此,我们提出 DepthART——一种新的深度自回归细化任务训练方法。不同于传统 VAR 采用静态输入与目标,本方法基于模型输出实现动态目标构建,实现自我细化。通过利用模型自身预测作为训练输入(而非真实标记图),我们将目标建模为残差最小化,有效减小训练与推理过程的差距。实验结果表明,所提训练方法显著提升了 VAR 在深度估计任务中的性能。使用本方法在 Hypersim 数据集上训练的模型,在多个不可见基准上均优于现有生成式和判别式基线。
引用
@article{arxiv.2409.15010,
title = {DepthART: Monocular Depth Estimation as Autoregressive Refinement Task},
author = {Bulat Gabdullin and Nina Konovalova and Nikolay Patakin and Dmitry Senushkin and Anton Konushin},
journal= {arXiv preprint arXiv:2409.15010},
year = {2025}
}