IP-MOT:面向跨域多目标跟踪的实例提示学习
计算机视觉与模式识别
2024-11-01 v1
摘要
多目标跟踪(MOT)旨在关联视频帧中的多个对象,是由于跟踪环境中固有的复杂性而具有挑战性的视觉任务。大多数现有方法在单个域内训练和跟踪,导致缺乏对其他域数据的跨域通用性。虽然已有工作引入自然语言表示以桥接视觉跟踪中的域缝隙,但这些文本描述往往过于高层,无法区分同一类别内的各种实例。为此本文开发了 IP-MOT,一种无需具体文本描述即可运行的 novel 端到端 transformer 模型用于 MOT。我们的方案基于两个关键创新:首先,利用预训练视觉语言模型,我们通过提示调谐获取与不同跟踪场景不变的实例级伪文本描述;其次,我们引入查询平衡策略,辅以知识蒸馏,进一步提升模型的泛化能力。在包括 MOT17、MOT20 和 DanceTrack 在内的三个广泛使用的 MOT 基准测试上进行的广泛实验表明,我们的方法不仅在同域数据上与最先进模型保持竞争力,还能显著提升查询式跟踪器对跨域输入的性能。
引用
@article{arxiv.2410.23907,
title = {IP-MOT: Instance Prompt Learning for Cross-Domain Multi-Object Tracking},
author = {Run Luo and Zikai Song and Longze Chen and Yunshui Li and Min Yang and Wei Yang},
journal= {arXiv preprint arXiv:2410.23907},
year = {2024}
}