面向标准CNN语义分割的等距柱状投影图像构建方法
计算机视觉与模式识别
2023-10-16 v1
摘要
360°球面图像具有视野广的优势,通常投影到平面进行处理,即等距柱状投影图像。等距柱状投影图像中物体形状可能发生畸变且缺乏平移不变性。此外,带有标签的等距柱状投影图像公开数据集很少,这给标准CNN模型有效处理等距柱状投影图像带来了挑战。为解决该问题,我们提出了一种将透视图像转换为等距柱状投影图像的方法。该方法采用球面中心投影的逆变换和等距圆柱投影。这使得标准CNN能够学习等距柱状投影图像中不同位置的畸变特征,从而具备对等距柱状投影图像进行语义分割的能力。决定透视图像投影位置的参数φ已使用多种数据集和模型(如UNet、UNet++、SegNet、PSPNet和DeepLab v3+)进行了分析。实验表明,对于标准CNN有效语义分割等距柱状投影图像,φ的最优值为6π/16。与其他三类方法(监督学习、无监督学习和数据增强)相比,本文提出的方法取得了43.76%的最佳平均IoU值,分别比其他三类方法高出23.85%、10.7%和17.23%。
引用
@article{arxiv.2310.09122,
title = {Equirectangular image construction method for standard CNNs for Semantic Segmentation},
author = {Haoqian Chen and Jian Liu and Minghe Li and Kaiwen Jiang and Ziheng Xu and Rencheng Sun and Yi Sui},
journal= {arXiv preprint arXiv:2310.09122},
year = {2023}
}