SwinMTL:基于单摄像机图像的深度估计与语义分割的共享架构
计算机视觉与模式识别
2024-03-19 v1
摘要
本研究论文提出了一种创新的多任务学习框架,允许单摄像机同时进行深度估计和语义分割。该方法基于共享的编码器-解码器架构,集成了 various 技术以提高深度估计和语义分割任务的准确性,而不会牺牲计算效率。此外,论文采用对抗训练组件,运用带有批判网络的 Wasserstein GAN 框架来细化模型预测。该框架在两个数据集上进行了彻底评估——户外 Cityscapes 数据集和室内 NYU Depth V2 数据集——在分割和深度估计任务中均优于现有最先进方法。我们还进行了消融研究,以分析不同组件的贡献,包括预训练策略、批判器的包含、对数深度缩放以及高级图像增强,以更好地理解该框架。随附的源代码可访问于 \url{https://github.com/PardisTaghavi/SwinMTL}。
引用
@article{arxiv.2403.10662,
title = {SwinMTL: A Shared Architecture for Simultaneous Depth Estimation and Semantic Segmentation from Monocular Camera Images},
author = {Pardis Taghavi and Reza Langari and Gaurav Pandey},
journal= {arXiv preprint arXiv:2403.10662},
year = {2024}
}