基于最优传输的域自适应语义分割
计算机视觉与模式识别
2023-03-30 v1 最优化与控制
摘要
场景分割广泛应用于自动驾驶的环境感知领域,而语义场景分割(3S)因所含语义信息丰富而备受关注。其旨在为图像中的像素分配标签,从而实现图像自动标注。当前方法主要基于卷积神经网络(CNN),但依赖大量标签。因此,如何利用小规模标注数据实现语义分割变得愈发重要。本文提出一种基于最优传输(OT)和注意力机制的域自适应(DA)框架以解决该问题。具体而言,首先利用 CNN 生成输出空间,因其特征表示优势。其次,我们利用 OT 在输出空间实现源域与目标域更鲁棒的对齐,其中 OT 规划定义了一种良好的注意力机制以提升模型适应性。特别地,借助 OT,网络参数量得以减少且网络具有更好可解释性。第三,为更好描述特征多尺度特性,我们构建多尺度分割网络进行域自适应。最后,为验证所提方法性能,我们在三个场景数据集上与三种基准和四种 SOTA 方法进行了实验对比,平均交并比(mIOU)显著提升,且多域自适应场景下的可视化结果也表明所提方法优于对比语义分割方法。
引用
@article{arxiv.2303.16435,
title = {Domain Adaptive Semantic Segmentation by Optimal Transport},
author = {Yaqian Guo and Xin Wang and Ce Li and Shihui Ying},
journal= {arXiv preprint arXiv:2303.16435},
year = {2023}
}