中文

面向视觉跟踪中负样本高效训练的方法

计算机视觉与模式识别 2023-09-07 v1

摘要

当前视觉目标跟踪的最先进(SOTA)方法常需大量计算资源与海量训练数据,导致过拟合风险。本研究引入一种更高效的训练策略,以缓解过拟合并降低计算需求。我们从一开始就以正负样本混合来平衡训练过程,称为联合负样本学习(JN)。负样本指模板中的目标未出现在搜索区域的情形,这有助于防止模型简单记忆目标,而是促使其利用模板进行目标定位。为有效处理负样本,我们采用基于分布的预测头,将边界框建模为距离分布以表达负样本存在时目标位置的不确定性,提供了一种管理混合样本训练的高效方式。此外,我们的方法引入目标指示令牌,其封装了模板图像中目标的精确位置。该方法以可忽略的计算代价提供精确边界细节,同时提升性能。我们的模型 JN-256 在具挑战性的基准上表现出优越性能,在 GOT-10k 上取得 75.8% AO,在 TrackingNet 上取得 84.1% AUC。值得注意的是,JN-256 优于此前使用更大模型与更高输入分辨率的 SOTA 跟踪器,尽管其仅以那些工作所用采样数据量的一半进行训练。

关键词

引用

@article{arxiv.2309.02903,
  title  = {Towards Efficient Training with Negative Samples in Visual Tracking},
  author = {Qingmao Wei and Bi Zeng and Guotian Zeng},
  journal= {arXiv preprint arXiv:2309.02903},
  year   = {2023}
}