中文

S3MOT:基于选择性状态空间模型的单目3D目标跟踪

计算机视觉与模式识别 2025-04-28 v1 人工智能

摘要

准确可靠的3D空间多目标跟踪(MOT)是推动机器人和计算机视觉应用的关键挑战。然而,在单目设置下,由于难以从2D视频流中挖掘3D时空关联,仍面临重大困难。本文提出了三项创新技术,以增强异构线索在单目3D MOT中的融合与利用:(1)引入匈牙利状态空间模型(Hungarian State Space Model, HSSM),一种新颖的数据关联机制,通过压缩多条路径上的上下文跟踪线索,实现线性复杂度的高效且全面的分配决策。HSSM具有全局感受野和动态权重,不同于传统依赖人工构建关联代价的线性分配算法。(2)提出全卷积单阶段嵌入(Fully Convolutional One-stage Embedding, FCOE),通过直接使用密集特征图进行对比学习,消除ROI池化,提高了在视点和光照变化等挑战条件下对象重识别的准确性。(3)通过VeloSSM(基于速度建模的时序依赖)增强6自由度姿态估计,这种编码器-解码器架构建模了速度中的时序依赖,捕捉运动动力学,克服了基于帧的3D推断局限性。在KITTI公开测试基准上的实验表明,我们的方法取得了76.86~HOTA(31~FPS)的新型态,净增+2.63~HOTA和+3.62~AssA,展示了其在单目3D MOT任务中的鲁棒性与效率。代码与模型已公开于https://github.com/bytepioneerX/s3mot。

关键词

引用

@article{arxiv.2504.18068,
  title  = {S3MOT: Monocular 3D Object Tracking with Selective State Space Model},
  author = {Zhuohao Yan and Shaoquan Feng and Xingxing Li and Yuxuan Zhou and Chunxi Xia and Shengyu Li},
  journal= {arXiv preprint arXiv:2504.18068},
  year   = {2025}
}