带语言对象约束的孪生网络跟踪
计算机视觉与模式识别
2020-11-25 v1
摘要
经典地,视觉目标跟踪涉及在给定视频中持续跟随目标对象,并为我们提供该对象的运动轨迹。然而,对于许多实际应用而言,这一输出往往不够,因为需要对视频素材施加额外的语义信息才能采取行动。此类应用的例子包括监控和特定目标视频摘要,其中需要按照某些预定义约束(例如“当站在黄色汽车附近时”)对目标进行监视。本文探索对受额外语言约束的视觉对象进行跟踪。与 Li 等人不同,我们在跟踪上施加额外的语言约束,从而实现了跟踪的新应用。而在他们的工作中,目标是改进和扩展跟踪本身。为进行基准测试和实验,我们贡献了两个数据集:c-MOT16 和 c-LaSOT,它们是通过向原始 LaSOT 和 MOT16 数据集的帧追加额外约束而整理得到的。我们还试验了两种深度模型 SiamCT-DFG 和 SiamCT-CA,它们通过扩展近期最先进的孪生跟踪方法并添加受自然语言处理和视觉问答领域启发的模块而获得。通过实验结果,我们表明所提出的模型 SiamCT-CA 能够显著优于其对应模型。此外,我们的方法能够基于约束的有效性对视频进行选择性压缩。
引用
@article{arxiv.2011.11721,
title = {Siamese Tracking with Lingual Object Constraints},
author = {Maximilian Filtenborg and Efstratios Gavves and Deepak Gupta},
journal= {arXiv preprint arXiv:2011.11721},
year = {2020}
}