基于双阶段掩码自编码器的室内深度完成网络
计算机视觉与模式识别
2024-06-17 v1
摘要
深度图像在3D重建、自动驾驶、增强现实、机器人导航和场景理解等方面具有广泛应用。商业级深度相机在处理亮色、光面、透明和远距离表面时难以测深。尽管已有深度完成方法取得了显著进展,但在复杂室内场景下的性能仍受限。为此,本文提出一种基于Transformer的两步方法,用于室内深度完成。不同于现有方法,本文采用基于掩码自编码器的自监督预训练编码器,以学习缺失深度值有效的潜在表示;随后提出一种基于token融合机制的解码器,用于从RGB图和不完整深度图联合完成(即重建)完整深度。与现有方法相比,本文提出的网络在Matterport3D数据集上实现了最先进的性能。此外,为验证深度完成任务的重要性,我们将本方法应用于室内3D重建。代码、数据集和演示均已公开:https://github.com/kailaisun/Indoor-Depth-Completion。
引用
@article{arxiv.2406.09792,
title = {A Two-Stage Masked Autoencoder Based Network for Indoor Depth Completion},
author = {Kailai Sun and Zhou Yang and Qianchuan Zhao},
journal= {arXiv preprint arXiv:2406.09792},
year = {2024}
}
备注
Accepted by 2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshop