通过多模板与时序网络以轻量或无需训练改进基于孪生网络的跟踪器
计算机视觉与模式识别
2024-10-16 v2
摘要
在大型数据集上训练基于深度学习的跟踪器通常需要较高的计算能力和大量时间。受诸多因素影响,训练有时并非可行之选。本文针对基于孪生网络(Siamese-based)的跟踪器提出一个包含两点思路的框架:(i) 以无需重新训练网络的方式扩展模板数量;(ii) 一种轻量时序网络,其新颖架构同时关注局部与全局信息,可独立于跟踪器使用。大多数基于孪生网络的跟踪器仅以第一帧作为目标真值,当后续帧中目标外观发生显著变化且存在相似干扰物时表现不佳。部分跟踪器使用多模板,但大多依赖恒定阈值进行更新,或仅以相似度更低的模板替换为相似度更高的模板。与以往工作不同,我们采用自适应阈值,将相似模板及略有差异的模板一并更新入模板集。自适应阈值相较恒定阈值亦带来整体性能提升。此外,在网络最后阶段混合各模板所得特征图,消除了重新训练跟踪器的必要。我们提出的轻量时序网络 CombiNet 仅利用目标坐标学习不同物体的路径历史,并预测其在下一帧中的潜在位置。该网络独立于跟踪器,应用于新跟踪器时无需额外训练。通过实现上述思路,跟踪器在所有测试数据集上的性能均获提升,包括 LaSOT、LaSOT 扩展集、TrackingNet、OTB100、OTB50、UAV123 与 UAV20L。实验表明所提框架在卷积与基于 transformer 的跟踪器上均表现良好。本文的官方 Python 代码将在发表后公开。
引用
@article{arxiv.2211.13812,
title = {Improving Siamese Based Trackers with Light or No Training through Multiple Templates and Temporal Network},
author = {Ali Sekhavati and Won-Sook Lee},
journal= {arXiv preprint arXiv:2211.13812},
year = {2024}
}