用于精确跟踪的目标变换回归
计算机视觉与模式识别
2021-04-02 v1
摘要
由于视频中目标的外观变化、姿态与视角改变以及几何形变,精确跟踪仍是一项具有挑战性的任务。近期的无锚框跟踪器提供了高效的回归机制,但无法产生精确的边界框估计。为解决这些问题,本文重新设计了一个类 Transformer 的回归分支,称为目标变换回归(TREG),用于精确的无锚框跟踪。我们 TREG 的核心是对目标模板与搜索区域中元素之间的成对关系进行建模,并利用所得的目标增强视觉表征进行精确的边界框回归。这种目标上下文表征能够增强目标相关信息以帮助精确定位边界框,并由于其局部稠密匹配机制在一定程度上处理目标形变。此外,我们设计了一种简单的在线模板更新机制来选择可靠模板,提升了对于目标随时间外观变化和几何形变的鲁棒性。在包括 VOT2018、VOT2019、OTB100、GOT10k、NFS、UAV123、LaSOT 和 TrackingNet 的视觉跟踪基准上的实验结果表明,TREG 取得了最先进的性能,在 LaSOT 上达到 0.640 的成功率,同时以约 30 FPS 运行。代码与模型将发布于 https://github.com/MCG-NJU/TREG。
引用
@article{arxiv.2104.00403,
title = {Target Transformed Regression for Accurate Tracking},
author = {Yutao Cui and Cheng Jiang and Limin Wang and Gangshan Wu},
journal= {arXiv preprint arXiv:2104.00403},
year = {2021}
}