中文

S3PT: 场景语义与结构引导聚类以增强自动驾驶自监督预训练

计算机视觉与模式识别 2025-01-27 v3 人工智能 机器人学

摘要

近期基于自监督聚类的预训练技术如 DINO 和 Cribo 在下游检测与分割任务上取得了令人瞩目的结果。然而,自动驾驶等现实应用面临物体类别与尺寸分布不平衡以及复杂场景几何结构的挑战。在本文中,我们提出 S3PT,一种新颖的场景语义与结构引导聚类方法,为自监督训练提供更符合场景的目标。具体而言,我们的贡献有三方面:第一,我们引入语义分布一致聚类,以鼓励对摩托车或动物等稀有类别更好地进行表征。第二,我们提出对象多样性一致空间聚类,以处理不平衡且多样的物体尺寸,从大型背景区域到行人与交通标志等小型物体。第三,我们提出深度引导空间聚类,基于场景的几何信息对学习进行正则化,从而进一步细化特征层面的区域分离。我们学到的表征在 nuScenes、nuImages 和 Cityscapes 数据集上的下游语义分割与 3D 目标检测任务中显著提升了性能,并展现出有前景的域迁移特性。

关键词

引用

@article{arxiv.2410.23085,
  title  = {S3PT: Scene Semantics and Structure Guided Clustering to Boost Self-Supervised Pre-Training for Autonomous Driving},
  author = {Maciej K. Wozniak and Hariprasath Govindarajan and Marvin Klingner and Camille Maurice and B Ravi Kiran and Senthil Yogamani},
  journal= {arXiv preprint arXiv:2410.23085},
  year   = {2025}
}

备注

Accepted for WACV 2025 (Oral)