中文

PCT:用于多相机鸟瞰图分割的透视线索训练框架

计算机视觉与模式识别 2024-07-16 v2

摘要

为鸟瞰图(Bird's-Eye-View, BEV)分割生成标注面临巨大挑战,因为场景复杂且人工标注成本高昂。在这项工作中,我们通过利用大量可用的无标签数据来应对这些挑战。我们提出了透视线索训练(Perspective Cue Training, PCT)框架,这是一种新颖的训练框架,利用公开可用的大型街景数据集上训练的语义分割模型,从无标签透视图像生成伪标签。PCT 将透视视图任务头应用于与 BEV 分割头共享的图像编码器,有效利用无标签数据与生成的伪标签进行训练。由于图像编码器几乎存在于所有基于相机的 BEV 分割架构中,PCT 灵活且适用于各种现有的 BEV 架构。PCT 可应用于各种有无标签数据可用的设置。在本文中,我们将 PCT 应用于半监督学习(Semi-Supervised Learning, SSL)和无监督领域自适应(Unsupervised Domain Adaptation, UDA)。此外,我们通过相机丢弃(Camera Dropout, CamDrop)引入强输入扰动,并通过 BEV 特征丢弃(BEV Feature Dropout, BFD)引入特征扰动,这对于利用我们的师生框架增强 SSL 能力至关重要。我们的综合方法简单灵活,但在 SSL 和 UDA 的各种基线上取得了显著改进,甚至与当前最先进技术相比也达到了有竞争力的性能。

关键词

引用

@article{arxiv.2403.12530,
  title  = {PCT: Perspective Cue Training Framework for Multi-Camera BEV Segmentation},
  author = {Haruya Ishikawa and Takumi Iida and Yoshinori Konishi and Yoshimitsu Aoki},
  journal= {arXiv preprint arXiv:2403.12530},
  year   = {2024}
}

备注

13 pages, 5 figures; Accepted to IROS 2024