中文

DeTrack:用于视觉目标跟踪的模型内潜在去噪学习

计算机视觉与模式识别 2025-01-07 v1

摘要

以往的视觉目标跟踪方法采用图像特征回归模型或坐标自回归模型进行边界框预测。图像特征回归方法严重依赖匹配结果,且未利用位置先验;而自回归方法只能使用训练集中可用的边界框进行训练,可能导致在测试时对未见数据表现次优。受扩散模型启发,去噪学习增强了模型对未见数据的鲁棒性。因此,我们向边界框引入噪声,生成带噪框用于训练,从而增强模型在测试数据上的鲁棒性。我们提出一种新范式,将视觉目标跟踪问题表述为去噪学习过程。然而,跟踪算法通常需要实时运行,直接将扩散模型应用于目标跟踪会严重降低跟踪速度。因此,我们将去噪学习过程分解为模型内的每个去噪块,而不是多次运行模型,从而将所提出的范式总结为模型内潜在去噪学习过程。具体而言,我们提出一种去噪视觉Transformer(ViT),由多个去噪块组成。在去噪块中,模板和搜索嵌入被投影到每个去噪块中作为条件。一个去噪块负责去除预测边界框中的噪声,多个堆叠的去噪块协作完成整个去噪过程。随后,我们利用图像特征和轨迹信息来优化去噪后的边界框。此外,我们还利用轨迹记忆和视觉记忆来提高跟踪稳定性。实验结果验证了我们方法的有效性,在多个具有挑战性的数据集上取得了有竞争力的性能。

关键词

引用

@article{arxiv.2501.02467,
  title  = {DeTrack: In-model Latent Denoising Learning for Visual Object Tracking},
  author = {Xinyu Zhou and Jinglun Li and Lingyi Hong and Kaixun Jiang and Pinxue Guo and Weifeng Ge and Wenqiang Zhang},
  journal= {arXiv preprint arXiv:2501.02467},
  year   = {2025}
}

备注

Accepted by NeurIPS 2024