EDADepth:用于单目深度估计的增强数据增强方法
计算机视觉与模式识别
2024-10-04 v2
摘要
由于其文本到图像的合成特性,扩散模型最近在深度估计等视觉感知任务中兴起。高质量数据集的缺乏使得扩散模型难以提取细粒度的语义上下文。细节较少的语义上下文进一步恶化了创建有效文本嵌入的过程,而这些嵌入将用作扩散模型的输入。在本文中,我们提出了一种新颖的 EDADepth,一种增强的数据增强方法,用于在不使用额外训练数据的情况下估计单目深度。我们使用超分辨率模型 Swin2SR 来增强输入图像的质量。我们采用 BEiT 预训练语义分割模型来更好地提取文本嵌入。我们使用 BLIP-2 分词器从这些文本嵌入生成词元。我们方法的新颖之处在于将 Swin2SR、BEiT 模型和 BLIP-2 分词器引入到基于扩散的单目深度估计流程中。我们的模型在 NYUv2 和 KITTI 数据集上的 delta3 指标上取得了最先进的结果。它在 RMSE 和 REL 指标上也取得了与 SOTA 模型相当的结果。最后,与 SOTA 的基于扩散的单目深度估计模型相比,我们还展示了估计深度可视化的改进。代码:https://github.com/edadepthmde/EDADepth_ICMLA。
引用
@article{arxiv.2409.06183,
title = {EDADepth: Enhanced Data Augmentation for Monocular Depth Estimation},
author = {Nischal Khanal and Shivanand Venkanna Sheshappanavar},
journal= {arXiv preprint arXiv:2409.06183},
year = {2024}
}