FreDSNet:基于快速傅里叶卷积的单目深度与语义分割联合网络
计算机视觉与模式识别
2024-02-06 v2 人工智能
机器人学
摘要
在这项工作中,我们提出 FreDSNet,一种从单张全景图获取室内环境语义三维理解的深度学习方案。全景图像由于提供关于整个环境的 360 度上下文信息,在解决场景理解问题时展现出任务特定的优势。然而,全景图像的内在特性给准确检测和分割物体或良好深度估计带来了额外问题。为克服这些问题,我们利用频域中的卷积,在每一卷积层获得更大的感受野。这些卷积能够利用全景图像的完整上下文信息。FreDSNet 是首个利用快速傅里叶卷积从单张全景图像联合提供单目深度估计与语义分割的网络。我们的实验表明,FreDSNet 在语义分割和深度估计上拥有与特定 SOTA 方法相似的性能。FreDSNet 代码公开于 https://github.com/Sbrunoberenguel/FreDSNet
引用
@article{arxiv.2210.01595,
title = {FreDSNet: Joint Monocular Depth and Semantic Segmentation with Fast Fourier Convolutions},
author = {Bruno Berenguel-Baeta and Jesus Bermudez-Cameo and Jose J. Guerrero},
journal= {arXiv preprint arXiv:2210.01595},
year = {2024}
}
备注
7 pages, 5 figures, 3 tables