语义、畸变与风格至关重要:面向全景分割的无源无监督域自适应
计算机视觉与模式识别
2024-03-25 v2
摘要
本文解决一个有趣但富有挑战的问题——针对针孔到全景语义分割的无源无监督域自适应(SFUDA)——仅给定一个针孔图像训练的模型(即源域)和无标签的全景图像(即目标域)。由于语义不匹配、风格差异以及全景图像不可避免的畸变,解决该问题并非易事。为此,我们提出一种新颖方法,利用切线投影(TP),因其畸变较小,同时以固定视场角分割等距柱状投影(ERP)来模拟针孔图像。两种投影均被证明能有效从源模型提取知识。然而,源域与目标域之间显著的投影差异阻碍了知识的直接迁移;因此,我们提出全景原型自适应模块(PPAM),从提取的知识中整合全景原型以进行自适应。随后,我们在预测和原型上施加损失约束,并在特征层面提出交叉对偶注意力模块(CDAM),以更好地对齐跨域和跨投影的空间与通道特性。知识提取与迁移过程同步更新以达到最佳性能。在合成与真实世界基准(包括室外与室内场景)上的大量实验表明,我们的方法在针孔到全景自适应方面显著优于先前的 SFUDA 方法。
引用
@article{arxiv.2403.12505,
title = {Semantics, Distortion, and Style Matter: Towards Source-free UDA for Panoramic Segmentation},
author = {Xu Zheng and Pengyuan Zhou and Athanasios V. Vasilakos and Lin Wang},
journal= {arXiv preprint arXiv:2403.12505},
year = {2024}
}
备注
Accepted to CVPR 2024