学习匹配:面向视觉跟踪的自动匹配网络设计
计算机视觉与模式识别
2021-08-03 v1
摘要
孪生网络跟踪近年来取得了突破性的性能,其精髓在于高效的互相关及其变体匹配算子。除了显著的成功之外,需注意启发式匹配网络设计严重依赖专家经验。此外,我们通过实验发现,单一匹配算子难以保证在所有挑战性环境中稳定跟踪。因此,本文从特征融合而非显式相似度学习的角度引入六种新颖匹配算子,即拼接(Concatenation)、逐点相加(Pointwise-Addition)、成对关系(Pairwise-Relation)、FiLM、简单Transformer(Simple-Transformer)和直推式引导(Transductive-Guidance),以探索匹配算子选择的更多可行性。分析揭示了这些算子对不同环境退化类型的选择性适应能力,启发我们将其组合以探索互补特征。为此,我们提出二值通道操纵(binary channel manipulation, BCM)来搜索这些算子的最优组合。BCM 通过学习某一算子对其他跟踪步骤的贡献,决定保留或丢弃该算子。将学习到的匹配网络插入强基线跟踪器 Ocean 后,我们的模型在 OTB100、LaSOT 和 TrackingNet 上的成功率分别取得 、、 的显著提升。值得注意的是,我们的跟踪器名为 AutoMatch,使用的训练数据/时间不到基线跟踪器的一半,并在 PyTorch 下以 50 FPS 运行。代码和模型将发布于 https://github.com/JudasDie/SOTS。
引用
@article{arxiv.2108.00803,
title = {Learn to Match: Automatic Matching Network Design for Visual Tracking},
author = {Zhipeng Zhang and Yihao Liu and Xiao Wang and Bing Li and Weiming Hu},
journal= {arXiv preprint arXiv:2108.00803},
year = {2021}
}
备注
accepted by ICCV2021