RSA:通过语言描述解析单目深度估计中的尺度歧义
计算机视觉与模式识别
2024-11-05 v2
摘要
我们提出一种用于衡度尺度单目深度估计的方法。由于透视投影在图像形成过程中导致尺度信息丢失,单张图像推估深度是一个不可判定的问题。任何选取的尺度都是偏差,通常源于数据集训练;因此,现有方法倾向于使用相对(归一化、倒数)深度。我们的目标是通过线性变换恢复衡度尺度深度图。本方法的核心在于,某些物体(如汽车、树木、街灯)通常出现或与特定场景(如户外)相关联。我们探讨了是否可利用语言描述将相对深度预测转化为衡度尺度深度。我们的RSA方法以描述图像中物体的文本标题为输入,输出可用于将相对深度图整体转化为衡度尺度深度预测的线性变换参数。我们在室内(NYUv2、VOID)和户外(KITTI)数据集上对最近的通用单目深度模型进行验证。在训练多个数据集后,RSA可作为零样本设置下的通用对齐模块。我们的方法优于常规的相对深度转衡度深度对齐实践,预测结果与通过线性变换拟合相对深度至真实深度的上界相当。
引用
@article{arxiv.2410.02924,
title = {RSA: Resolving Scale Ambiguities in Monocular Depth Estimators through Language Descriptions},
author = {Ziyao Zeng and Yangchao Wu and Hyoungseob Park and Daniel Wang and Fengyu Yang and Stefano Soatto and Dong Lao and Byung-Woo Hong and Alex Wong},
journal= {arXiv preprint arXiv:2410.02924},
year = {2024}
}