中文

基于激活语义的LiDAR 3D目标检测的时空融合方法

计算机视觉与模式识别 2025-03-18 v2

摘要

LiDAR 基于的3D目标检测由于LiDAR点的本征稀疏性,面临着显著挑战。常见解决方案是利用长期LiDAR数据加 densify 输入。然而,高效利用时空信息仍是一个开放问题。本文提出一种新颖的语义监督时空融合(ST-Fusion)方法,引入新颖的融合模块以缓解对象在时间内因运动导致的空间错位,并通过特征级语义监督充分挖掘所提出融合模块的能力。具体而言,ST-Fusion 包括空间聚合(SA)模块和时序合并(TM)模块。SA 模块采用渐进扩大感受野的卷积层从局部区域聚合对象特征,以缓解空间错位;TM 模块基于注意力机制从前序帧中动态提取对象特征,以全面序列方式呈现。此外,在语义监督方面,我们提出一种语义注入方法,通过注入点级语义标签丰富稀疏LiDAR数据,用于训练教师模型,并通过所提出的对象感知损失在特征层提供重构目标。广泛的在各种LiDAR 基于检测器上的实验表明,我们的方法有效且通用,基于nuScenes基准测试可实现约+2.8%的NDS提升。

关键词

引用

@article{arxiv.2503.10579,
  title  = {Semantic-Supervised Spatial-Temporal Fusion for LiDAR-based 3D Object Detection},
  author = {Chaoqun Wang and Xiaobin Hong and Wenzhong Li and Ruimao Zhang},
  journal= {arXiv preprint arXiv:2503.10579},
  year   = {2025}
}

备注

Accepted by ICRA2025