序列化 3D 对象检测的体素稠密化:通过预序列化扩张缓解稀疏性
计算机视觉与模式识别
2026-02-26 v3
摘要
近期在点云目标检测中采用的基于 Transformer 和状态空间模型(SSMs)的方法,试图捕获长程依赖关系。然而,这些序列化框架严格维持输入与输出体素维度的一致性,本质上缺乏体素扩张的能力。此限制阻碍了性能提升,因为扩充体素集合已被证明能显著提高检测精度,尤其是针对稀疏前景对象的检测。为弥合这一差距,我们提出一种新型体素稠密化模块(VDM)。不同于标准卷积干线,VDM 专为促进预序列化空间扩张而设计。它利用稀疏 3D 卷积将前景语义传递至相邻空白体素,从而在特征被展平为序列之前实现稠密化。同时,VDM 融合残差稀疏模块以聚合细粒度局部上下文,确保富有信息的几何特征提取。为平衡增大后体素密度带来的计算开销,我们引入一种策略性级联下采样机制。我们将 VDM 集成到基于 Transformer(DSVT)和 SSM(LION)检测器中。大量实验表明,VDM 在多个基准数据集上均一致提升了检测精度。具体而言,我们的方法在 Waymo 验证集上达到 74.8 mAPH(L2),在 nuScenes 测试集上达到 70.5 mAP。在 Argoverse 2 验证集上达到 42.6 mAP,在 ONCE 验证集上达到 67.6 mAP,始终优于基线模型。该源代码将在 https://github.com/qifeng22/VDM 上公开。
引用
@article{arxiv.2508.16069,
title = {Voxel Densification for Serialized 3D Object Detection: Mitigating Sparsity via Pre-serialization Expansion},
author = {Qifeng Liu and Dawei Zhao and Yabo Dong and Linzhi Shang and Liang Xiao and Juan Wang and Kunkong Zhao and Dongming Lu and Qi Zhu},
journal= {arXiv preprint arXiv:2508.16069},
year = {2026}
}
备注
Under review