RegTrack:鲁棒多模态3D多目标跟踪中复杂之下的简洁
计算机视觉与模式识别
2026-02-25 v3
摘要
现有的3D多目标跟踪(MOT)方法常为追求鲁棒性而牺牲效率和泛化能力,很大程度上依赖于源自多模态架构和特定类别运动先验的复杂关联度量。我们挑战“更高复杂度必然带来更强鲁棒性”这一根深蒂固的观念,提出了一种鲁棒、高效且可泛化的多模态3D MOT方法,称为RegTrack。受杨-米尔斯规范场论启发,RegTrack构建于一个统一的三线索编码器(UTEnc)之上,该编码器包含三个紧密耦合的组件:局部-全局点云编码器(LG-PEnc)、基于混合专家的几何编码器(MoE-GEnc)以及来自预训练良好的视觉-语言模型的图像编码器。LG-PEnc高效编码点云的空间和结构信息,为每个对象生成基础表示,其成对相似度作为唯一的关联度量。MoE-GEnc与LG-PEnc无缝交互,建模跨帧的对象间几何关系,无需依赖任何特定类别先验即可自适应补偿帧间对象运动。图像编码器保持冻结,仅在训练期间使用,以提供一个预训练良好的表示空间。点云表示与该空间对齐,以监督运动补偿过程,鼓励同一对象跨帧的表示不变性,同时增强不同对象间的可区分性。通过这种设计,RegTrack仅使用点云输入即可实现鲁棒、高效且可泛化的推理,仅需2.6M参数。在KITTI和nuScenes上的大量实验表明,RegTrack性能优于其三十五个竞争对手。
引用
@article{arxiv.2409.00618,
title = {RegTrack: Simplicity Beneath Complexity in Robust Multi-Modal 3D Multi-Object Tracking},
author = {Lipeng Gu and Xuefeng Yan and Song Wang and Mingqiang Wei},
journal= {arXiv preprint arXiv:2409.00618},
year = {2026}
}