中文

MoPA:面向 3D 语义分割的多模态先验辅助域适应

计算机视觉与模式识别 2023-09-22 v1 机器人学

摘要

多模态无监督域适应(MM-UDA)用于 3D 语义分割是一种在自主系统中嵌入语义理解而无需昂贵逐点标注的实用方案。尽管先前的 MM-UDA 方法能取得整体改进,它们却受显著的类不平衡性能所困,限制了其在真实应用中的采用。该不平衡性能主要由以下原因造成:1)基于不平衡数据的自训练;2)缺乏像素级 2D 监督信号。本工作中,我们提出多模态先验辅助(MoPA)域适应以提升稀有对象的性能。具体而言,我们开发了有效基于地面的插入(VGI),通过插入从真实场景中收集的先验稀有对象来纠正不平衡监督信号,同时避免引入导致平凡解的人工伪影。同时,我们的 SAM 一致性损失利用来自 SAM 的 2D 先验语义掩码作为像素级监督信号,以鼓励语义掩码中每个对象的一致预测。从模态特定先验中学到的知识随后跨模态共享,以实现更好的稀有对象分割。大量实验表明,我们的方法在具挑战性的 MM-UDA 基准上取得了最先进(SOTA)性能。代码将发布于 https://github.com/AronCao49/MoPA。

关键词

引用

@article{arxiv.2309.11839,
  title  = {MoPA: Multi-Modal Prior Aided Domain Adaptation for 3D Semantic Segmentation},
  author = {Haozhi Cao and Yuecong Xu and Jianfei Yang and Pengyu Yin and Shenghai Yuan and Lihua Xie},
  journal= {arXiv preprint arXiv:2309.11839},
  year   = {2023}
}