中文

DINO-CoDT:基于视觉基础模型的多类协同检测与跟踪

计算机视觉与模式识别 2025-06-10 v1

摘要

协同感知在扩大感知范围、提高对传感器故障的鲁棒性方面发挥着关键作用,主要涉及协同3D检测和跟踪任务。前者关注单帧中的目标识别,而后者捕获连续的时间内实例轨迹。然而,现有工作主要聚焦于车辆 superclass,缺乏有效的多类协同检测与跟踪解决方案。这一限制阻碍了其在现实场景中的应用,这些场景涉及具有不同外观和运动模式的多样化目标类别。为克服这些限制,我们提出了一个针对多样化道路用户的多类协同检测与跟踪框架。我们首先提出了一个具有全局空间注意力融合(GSAF)模块的检测器,增强了对不同尺寸目标的多尺度特征学习。接着,我们引入一个轨迹重识别(REID)模块,利用视觉基础模型来有效减少ID交换(IDSW)错误,这在涉及小目标(如行人)的错误匹配情况下尤为重要。我们进一步设计了一个基于速度的自适应轨迹管理(VATM)模块,根据目标运动动态调整跟踪间隔。广泛的实验在V2X-Real和OPV2V数据集上表明,我们的方法在检测和跟踪精度方面显著优于现有最先进方法。

关键词

引用

@article{arxiv.2506.07375,
  title  = {DINO-CoDT: Multi-class Collaborative Detection and Tracking with Vision Foundation Models},
  author = {Xunjie He and Christina Dao Wen Lee and Meiling Wang and Chengran Yuan and Zefan Huang and Yufeng Yue and Marcelo H. Ang},
  journal= {arXiv preprint arXiv:2506.07375},
  year   = {2025}
}