SGAT4PASS:面向全景语义分割的球面几何感知Transformer
计算机视觉与模式识别
2024-03-13 v2 人工智能
机器学习
多媒体
摘要
作为计算机视觉中一个重要且具有挑战性的问题,全景语义分割(PASS)基于超广视角提供完整的场景感知。通常,以 2D 全景图像为输入的现有 PASS 方法侧重于解决图像畸变,却缺乏对原始 数据 3D 属性的考量。因此,当输入带有 3D 扰动的全景图像时,其性能会大幅下降。为对 3D 扰动更具鲁棒性,我们提出面向全景语义分割的球面几何感知 Transformer(SGAT4PASS),其考虑了 3D 球面几何知识。具体而言,我们提出了一个球面几何感知的 PASS 框架。它包含三个模块,即球面几何感知图像投影、球面可变形补丁嵌入以及全景感知损失,分别用于考虑带 3D 扰动的输入图像、在现有可变形补丁嵌入上添加球面几何感知约束,以及指示原始 数据的像素密度。在 Stanford2D3D 全景数据集上的实验结果表明,SGAT4PASS 显著提升了性能与鲁棒性,mIoU 提升约 2%,且当数据中出现微小 3D 扰动时,我们的性能稳定性提升了一个数量级。我们的代码与补充材料可在 https://github.com/TencentARC/SGAT4PASS 获取。
引用
@article{arxiv.2306.03403,
title = {SGAT4PASS: Spherical Geometry-Aware Transformer for PAnoramic Semantic Segmentation},
author = {Xuewei Li and Tao Wu and Zhongang Qi and Gaoang Wang and Ying Shan and Xi Li},
journal= {arXiv preprint arXiv:2306.03403},
year = {2024}
}
备注
Accepted by IJCAI 2023