通过引入自然语言表征将多目标跟踪泛化至未知域
计算机视觉与模式识别
2022-12-06 v1
摘要
尽管现有的多目标跟踪(MOT)算法在各种基准上已取得具有竞争力的性能,但几乎所有这些算法都在同一域上训练和验证模型。MOT 的域泛化问题鲜有研究。为弥补这一空白,我们首先观察到自然语言中所包含的高层信息对不同跟踪域是域不变的。基于该观察,我们提出将自然语言表征引入视觉 MOT 模型以提升域泛化能力。然而,为每个跟踪目标标注文本描述是不可行的。为解决此问题,我们设计了两个模块,即视觉上下文提示(VCP)与视觉-语言混合(VLM)。具体而言,VCP 基于输入帧生成视觉提示。VLM 将生成的视觉提示与来自预定义 Trackbook 的文本提示相融合,获得实例级伪文本描述,其对不同跟踪场景是域不变的。通过在 MOT17 上训练模型并在 MOT20 上验证,我们观察到所提模块生成的伪文本描述大幅提升了基于查询的跟踪器的泛化性能。
引用
@article{arxiv.2212.01568,
title = {Generalizing Multiple Object Tracking to Unseen Domains by Introducing Natural Language Representation},
author = {En Yu and Songtao Liu and Zhuoling Li and Jinrong Yang and Zeming li and Shoudong Han and Wenbing Tao},
journal= {arXiv preprint arXiv:2212.01568},
year = {2022}
}
备注
Accepted by AAAI2023