GTI:基于语言查询的视频目标定位-跟踪-融合框架
计算机视觉与模式识别
2020-11-17 v2
摘要
本文研究基于语言查询的 Tracking by Language(语言驱动跟踪)任务,即根据语言查询在视频中定位目标框序列。我们提出一种称为 GTI 的框架,将问题分解为三个子任务:Grounding(定位)、Tracking(跟踪)和 Integration(融合)。三个子任务模块同时运行,逐帧预测框序列。“Grounding”根据语言查询直接预测所指区域。“Tracking”基于前几帧中已定位区域的历史来定位目标。“Integration”通过协同结合定位与跟踪生成最终预测。以“融合”任务为关键,我们探索如何指示每帧中已定位区域的质量并实现期望的互利组合。为此,我们提出一种“RT-integration”方法,定义并预测两个分数来引导融合:1) R-score 表示区域正确性,即定位预测是否准确覆盖目标;2) T-score 表示模板质量,即该区域是否提供有助于未来帧中改进跟踪的信息性视觉线索。我们给出了采用所提 RT-integration 的实时 GTI 实现,并在 LaSOT 和 Lingual OTB99 上对该框架进行基准测试,取得了极具前景的结果。此外,我们制作了 LaSOT 查询的消歧版本,以促进未来的语言驱动跟踪研究。
引用
@article{arxiv.1912.06316,
title = {Grounding-Tracking-Integration},
author = {Zhengyuan Yang and Tushar Kumar and Tianlang Chen and Jinsong Su and Jiebo Luo},
journal= {arXiv preprint arXiv:1912.06316},
year = {2020}
}