MambaFlow:一种用于场景流估计的新型流引导状态空间模型
计算机视觉与模式识别
2025-02-25 v1 人工智能
摘要
场景流估计旨在从连续点云帧中预测 3D 运动,这在自动驾驶领域具有重要意义。现有方法面临时空建模不足以及体素化过程中细粒度特征固有丢失等挑战。然而,Mamba 作为一种以线性复杂度实现全局建模的代表性状态空间模型(SSM),其成功为解决这些问题提供了有希望的方案。在本文中,我们提出了 MambaFlow,一种具有基于 Mamba 解码器的新型场景流估计网络。它利用精心设计的骨干网络实现时空特征的深度交互与耦合。创新性地,我们使用高效的基于 Mamba 的解码器,通过点偏移信息引导基于体素的特征的全局注意力建模,学习体素到点的模式,用于将共享体素表示去体素化为逐点特征。为了进一步增强模型在不同场景下的泛化能力,我们提出了一种新颖的场景自适应损失函数,能够自动适应不同的运动模式。在 Argoverse 2 基准测试上的大量实验表明,MambaFlow 在现有工作中以实时推理速度实现了 SOTA 性能,能够在真实城市场景中实现准确的流估计。代码可在 https://github.com/SCNU-RISLAB/MambaFlow 获取。
引用
@article{arxiv.2502.16907,
title = {MambaFlow: A Novel and Flow-guided State Space Model for Scene Flow Estimation},
author = {Jiehao Luo and Jintao Cheng and Xiaoyu Tang and Qingwen Zhang and Bohuan Xue and Rui Fan},
journal= {arXiv preprint arXiv:2502.16907},
year = {2025}
}