中文

WorDepth: 用于单目深度估计的变分语言先验

计算机视觉与模式识别 2024-06-04 v4 人工智能 计算与语言 机器学习 多媒体

摘要

从单张图像进行三维(3D)重建是一个具有固有歧义(如尺度)的不适定问题。从文本描述预测3D场景同样是不适定的(如物体的空间排列)。我们研究了一个问题:两种固有歧义的模态是否可以联合使用以产生度量尺度的重建。为了测试这一点,我们聚焦于单目深度估计问题,即从单张图像预测密集深度图,但附加一个描述场景的文本标题。为此,我们首先将文本标题编码为均值和标准差;使用变分框架,我们学习与文本标题对应的3D场景的合理度量重建的分布作为先验。为了“选择”特定的重建或深度图,我们通过一个条件采样器对给定图像进行编码,该采样器从变分文本编码器的潜在空间中采样,然后解码为输出深度图。我们的方法在文本分支和图像分支之间交替训练:在一个优化步骤中,我们从文本描述预测均值和标准差,并从标准高斯分布采样;在另一个步骤中,我们使用(图像)条件采样器进行采样。训练完成后,我们使用条件采样器直接从编码文本预测深度。我们在室内(NYUv2)和室外(KITTI)场景上展示了我们的方法,表明语言可以在两种场景中持续提高性能。

关键词

引用

@article{arxiv.2404.03635,
  title  = {WorDepth: Variational Language Prior for Monocular Depth Estimation},
  author = {Ziyao Zeng and Daniel Wang and Fengyu Yang and Hyoungseob Park and Yangchao Wu and Stefano Soatto and Byung-Woo Hong and Dong Lao and Alex Wong},
  journal= {arXiv preprint arXiv:2404.03635},
  year   = {2024}
}