中文

RELO:基于强化学习的视觉对象跟踪局部化方法

计算机视觉与模式识别 2026-05-20 v2 人工智能

摘要

传统视觉对象跟踪器通过手工空间先验(常以热力图形式)进行目标局部化。这些先验仅提供间接监督,与跟踪优化和评估指标(如交并比 IoU 和成功曲线下面积 AUC)不够匹配。我们提出 RELO(REinforcement-learning-to-LOcalize),一种用于视觉对象跟踪的强化学习到局部化方法,将目标局部化建模为马尔可夫决策过程。具体而言,RELO 用通过强化学习在空间位置上学习的局部化策略取代手工空间先验,奖励函数结合帧级 IoU 和序列级 AUC。我们还引入了层对齐时序 token 传播,以在帧之间提高语义一致性,计算开销几乎可以忽略。在多个基准上,RELO 取得优异结果,在无模板更新的情况下达到 LaSOText 数据集上的 57.5% AUC。这表明奖励驱动的局部化是视觉对象跟踪中先验驱动局部化的有效替代方案。

关键词

引用

@article{arxiv.2605.07379,
  title  = {RELO: Reinforcement Learning to Localize for Visual Object Tracking},
  author = {Xin Chen and Chuanyu Sun and Jiao Xu and Houwen Peng and Dong Wang and Huchuan Lu and Kede Ma},
  journal= {arXiv preprint arXiv:2605.07379},
  year   = {2026}
}

备注

ICML 2026 paper