SynCL:面向端到端多相机3D跟踪的实例感知对比学习协同训练策略
计算机视觉与模式识别
2025-05-19 v3
摘要
虽然现有的基于查询的3D端到端视觉跟踪器通过基于注意力的跟踪范式将检测与跟踪集成,但这两个鸡生蛋蛋生鸡的任务在共享同一参数时遇到了优化困难。我们的发现揭示,这些困难源于自注意力机制的两个固有约束,即对象查询的过度去重和跟踪查询的自中心注意力。相比之下,移除自注意力机制不仅最小程度地影响跟踪器的回归预测,而且倾向于生成更多的潜在候选框。基于这些分析,本文提出了SynCL,一种新颖的即插即用协同训练策略,旨在协同促进检测与跟踪的多任务学习。具体而言,我们提出了一种任务特定混合匹配模块,用于权重共享的交叉注意力解码器,将跟踪查询的目标与多个对象查询进行匹配,以利用自注意力机制所忽略的有前景候选者。为了灵活选择最优候选者以实现一对多匹配,我们还设计了由模型训练状态控制的动态查询过滤模块。此外,我们引入了实例感知对比学习以突破跟踪查询自中心注意力的障碍,有效弥合检测与跟踪之间的差距。无需额外推理开销,SynCL在各种基准上持续提升性能,并在nuScenes数据集上以58.9% AMOTA达到最先进性能。代码和原始结果将公开发布。
引用
@article{arxiv.2411.06780,
title = {SynCL: A Synergistic Training Strategy with Instance-Aware Contrastive Learning for End-to-End Multi-Camera 3D Tracking},
author = {Shubo Lin and Yutong Kou and Zirui Wu and Shaoru Wang and Bing Li and Weiming Hu and Jin Gao},
journal= {arXiv preprint arXiv:2411.06780},
year = {2025}
}
备注
11 pages, 6 figures