状态空间模型遇上Transformer:3D目标检测的新范式
计算机视觉与模式识别
2025-03-20 v2 人工智能
摘要
基于DETR的方法使用多层Transformer解码器迭代优化目标查询,在3D室内目标检测中展现了有前景的性能。然而,Transformer解码器中的场景点特征保持不变,导致后续解码器层的贡献极小,从而限制了性能提升。近期,状态空间模型(SSM)通过系统状态与输入之间的迭代交互展现了高效的上下文建模能力,且具有线性复杂度。受SSM启发,我们提出了一种新的3D目标检测范式——交互式状态空间模型目标检测(DEST)。在交互式SSM中,我们设计了一种新颖的依赖状态的状态空间模型参数化方法,使系统状态能够有效充当3D室内检测任务中的查询。此外,我们引入了四种针对点云和SSM特性的关键设计:序列化和双向扫描策略使SSM内的场景点之间实现双向特征交互;状态间注意力机制建模状态点之间的关系;而门控前馈网络增强了跨通道相关性。据我们所知,这是首次将查询建模为系统状态、将场景点建模为系统输入的方法,能够以线性复杂度同时更新场景点特征和目标查询特征。在两个具有挑战性的数据集上的广泛实验证明了基于DEST的方法的有效性。与GroupFree基线相比,我们的方法在ScanNet V2(+5.3 AP50)和SUN RGB-D(+3.2 AP50)数据集上取得了提升。基于VDETR基线,我们的方法在ScanNetV2和SUN RGB-D数据集上达到了新的SOTA。
引用
@article{arxiv.2503.14493,
title = {State Space Model Meets Transformer: A New Paradigm for 3D Object Detection},
author = {Chuxin Wang and Wenfei Yang and Xiang Liu and Tianzhu Zhang},
journal= {arXiv preprint arXiv:2503.14493},
year = {2025}
}
备注
Accepted by ICLR 2025. Project url: https://chuxwa.github.io/project_DEST/