中文

BEV-DG:用于三维语义分割域泛化的鸟瞰图跨模态学习

计算机视觉与模式识别 2023-08-15 v1

摘要

跨模态无监督域适应(UDA)旨在利用 2D-3D 数据的互补性来克服新域中标注的匮乏。然而,UDA 方法依赖于训练期间对目标域的访问,意味着训练好的模型仅在特定目标域中有效。有鉴于此,我们提出用于三维语义分割域泛化(DG)的鸟瞰图跨模态学习,称为 BEV-DG。DG 更具挑战性,因为模型在训练时无法访问目标域,意味着其需依靠跨模态学习来缓解域间隙。由于三维语义分割要求对每个点进行分类,现有跨模态学习直接逐点进行,对像素与点之间投影的错位十分敏感。为此,我们的方法旨在借助鸟瞰图下的跨模态学习来优化与域无关的表示建模。我们提出基于 BEV 的区域到区域融合(BAF)以在鸟瞰图下开展跨模态学习,其对点级错位具有更高的容错性。此外,为建模与域无关的表示,我们借助鸟瞰图下的跨模态学习提出 BEV 驱动的域对比学习(BDCL)。我们基于三个三维数据集设计了三种域泛化设置,BEV-DG 在所有设置中均以巨大优势显著优于当前最优竞争对手。

关键词

引用

@article{arxiv.2308.06530,
  title  = {BEV-DG: Cross-Modal Learning under Bird's-Eye View for Domain Generalization of 3D Semantic Segmentation},
  author = {Miaoyu Li and Yachao Zhang and Xu MA and Yanyun Qu and Yun Fu},
  journal= {arXiv preprint arXiv:2308.06530},
  year   = {2023}
}

备注

Accepted by ICCV 2023