iKUN: 无需重新训练即可与跟踪器对话
计算机视觉与模式识别
2024-03-12 v2
摘要
指代多目标跟踪(RMOT)旨在基于输入的文本描述跟踪多个目标。以往的工作通过简单地将额外的文本模块集成到多目标跟踪器中来实现这一点。然而,它们通常需要重新训练整个框架,并且在优化方面存在困难。在这项工作中,我们提出了一种可插入的知识统一网络,称为iKUN,以即插即用的方式实现与现成跟踪器的通信。具体而言,设计了一个知识统一模块(KUM),根据文本指导自适应地提取视觉特征。同时,为了提高定位精度,我们提出了一种神经版本的卡尔曼滤波器(NKF),根据当前运动状态动态调整过程噪声和观测噪声。此外,为了解决文本描述的开集长尾分布问题,提出了一种测试时相似性校准方法,用伪频率来细化置信度分数。在Refer-KITTI数据集上的大量实验验证了我们框架的有效性。最后,为了加速RMOT的发展,我们还贡献了一个更具挑战性的数据集Refer-Dance,通过为公开的DanceTrack数据集添加运动和服装描述。代码和数据集可在https://github.com/dyhBUPT/iKUN获取。
引用
@article{arxiv.2312.16245,
title = {iKUN: Speak to Trackers without Retraining},
author = {Yunhao Du and Cheng Lei and Zhicheng Zhao and Fei Su},
journal= {arXiv preprint arXiv:2312.16245},
year = {2024}
}
备注
CVPR 2024 camera-ready