中文

弯曲现实:面向全景语义分割的失真感知Transformer

计算机视觉与模式识别 2022-03-21 v2 机器人学 图像与视频处理

摘要

具有360度视角的全景图像包含了关于周围空间的详尽信息,为场景理解提供了丰富的基础。为了以鲁棒的全景分割模型的形式释放这一潜力,大量昂贵且像素级的标注对于成功至关重要。此类标注是可获得的,但主要来自于窄视角、针孔相机图像,这些图像在开箱即用时,作为训练全景模型的资源是次优的。360度全景图像中的失真和独特的图像特征分布阻碍了从标注丰富的针孔域的迁移,因此带来了显著的性能下降。为了克服这一域差异并将针孔与360度环绕视觉的语义标注结合起来,我们提出在可变形补丁嵌入(DPE)和可变形MLP(DMLP)组件中学习目标形变和全景图像失真,并将其融入我们用于全景语义分割的Transformer(Trans4PASS)模型中。最后,我们通过生成多尺度原型特征并在我们的互原型自适应(MPA)中对齐它们,将针孔与全景特征嵌入中的共享语义联系起来,以实现无监督域自适应。在室内Stanford2D3D数据集上,我们的带有MPA的Trans4PASS保持了与全监督最先进方法相当的性能,削减了超过1400张标注全景图的需求。在室外DensePASS数据集上,我们以14.39% mIoU打破了最先进水平,并将新标杆设定在56.38%。代码将在 https://github.com/jamycheung/Trans4PASS 公开。

关键词

引用

@article{arxiv.2203.01452,
  title  = {Bending Reality: Distortion-aware Transformers for Adapting to Panoramic Semantic Segmentation},
  author = {Jiaming Zhang and Kailun Yang and Chaoxiang Ma and Simon Reiß and Kunyu Peng and Rainer Stiefelhagen},
  journal= {arXiv preprint arXiv:2203.01452},
  year   = {2022}
}

备注

Accepted to CVPR2022. Code will be made publicly available at https://github.com/jamycheung/Trans4PASS