迁移至真实世界布局:一种用于场景自适应的深度感知框架
计算机视觉与模式识别
2024-08-01 v2
摘要
通过无监督域自适应(UDA)进行场景分割,可将从源合成数据获取的知识迁移到真实世界目标数据,这大大减少了对目标域中手动像素级标注的需求。为促进域不变特征学习,现有方法通常简单地通过复制粘贴像素来混合源域和目标域的数据。此类朴素方法通常次优,因为它们未考虑混合布局与真实世界场景的契合程度。真实世界场景具有固有布局。我们观察到,如人行道、建筑物和天空等语义类别显示出相对一致的深度分布,并可在深度图中清晰区分。基于该观察,我们提出一种深度感知框架,显式利用深度估计来混合类别,并以端到端方式促进分割与深度学习这两个互补任务。具体而言,该框架包含用于数据增强的深度引导上下文滤波器(DCF)和用于上下文学习的跨任务编码器。DCF 模拟真实世界布局,而跨任务编码器进一步自适应融合两任务间的互补特征。此外,值得注意的是若干公开数据集未提供深度标注。因此,我们利用现成的深度估计网络生成伪深度。大量实验表明,即使使用伪深度,我们所提方法在两个广泛使用的基准上取得了具竞争力的性能,即在 GTA 到 Cityscapes 上 77.7 mIoU,在 Synthia 到 Cityscapes 上 69.3 mIoU。
引用
@article{arxiv.2311.12682,
title = {Transferring to Real-World Layouts: A Depth-aware Framework for Scene Adaptation},
author = {Mu Chen and Zhedong Zheng and Yi Yang},
journal= {arXiv preprint arXiv:2311.12682},
year = {2024}
}
备注
ACM MM 2024 (Oral)