用于单目深度估计的高分辨率合成 RGB-D 数据集
计算机视觉与模式识别
2023-05-04 v1
摘要
准确的深度图在自动驾驶、场景重建、点云生成等多种应用中至关重要。然而,单目深度估计(MDE)算法常无法提供足够的纹理与锐度,且在同质场景中表现不一致。这些算法多使用 CNN 或基于视觉 transformer 的架构,需要大规模数据集进行监督训练。但是,在现有深度数据集上训练的 MDE 算法泛化性差,因而在多样真实场景中精度不足。此外,真实深度图要么分辨率较低要么稀疏,导致深度图相对不一致。一般而言,获取具有像素级精度的高分辨率真实数据集用于准确深度预测是一项昂贵且耗时的挑战。本文从 Grand Theft Auto(GTA-V)生成了尺寸为 1920 X 1080 的高分辨率合成深度数据集(HRSD),包含 100,000 张彩色图像及对应的稠密真实深度图。所生成数据集具有多样性,涵盖室内到室外、同质表面到纹理表面等场景。为实验与分析,我们在所提合成数据集上训练了当前最优的基于 transformer 的 MDE 算法 DPT,使不同场景深度图精度显著提升 9%。由于合成数据集分辨率更高,我们提出在 transformer 编码器中加入特征提取模块并引入基于注意力的损失,进一步将精度提升 15%。
引用
@article{arxiv.2305.01732,
title = {High-Resolution Synthetic RGB-D Datasets for Monocular Depth Estimation},
author = {Aakash Rajpal and Noshaba Cheema and Klaus Illgner-Fehns and Philipp Slusallek and Sunil Jaiswal},
journal= {arXiv preprint arXiv:2305.01732},
year = {2023}
}