中文

基于遮挡规划的实例级视觉主动跟踪

计算机视觉与模式识别 2026-04-24 v1

摘要

视觉主动跟踪(VAT)旨在控制相机在三维空间中跟随目标,这对于无人机导航和安防监控等应用至关重要。然而,它在实际部署中面临两个关键瓶颈:由于实例级区分不足,容易受到视觉上相似的干扰项干扰;在遮挡情况下因缺乏主动规划而严重失败。为解决这些问题,我们提出了 OA-VAT,一个包含三个互补模块的统一管道。首先,训练自由的实例感知离线原型初始化通过 DINOv3 聚合多视角增强特征,构建判别性实例原型,以缓解干扰项混淆。其次,线上原型增强跟踪器通过增强原型并集成置信度感知的卡尔曼滤波器,在外观和运动变化下实现稳定跟踪。最后,基于我们新的 Planning-20k 数据集训练的遮挡感知轨迹规划器使用条件扩散生成障碍规避路径,以实现遮挡恢复。实验表明,OA-VAT 在 UnrealCV 上实现 0.93 的平均 SR(相较于 SOTA TrackVLA 提升 2.2%),在真实数据集上实现 90.8% 的平均 CAR(相较于 SOTA GC-VAT 提升 12.1%),在 DJI Tello 无人机上实现 81.6% 的 TSR。该方法在 RTX 3090 上以 35 FPS 的速度,为实际部署提供了稳健、实时的性能。

关键词

引用

@article{arxiv.2604.21453,
  title  = {Instance-level Visual Active Tracking with Occlusion-Aware Planning},
  author = {Haowei Sun and Kai Zhou and Hao Gao and Shiteng Zhang and Jinwu Hu and Xutao Wen and Qixiang Ye and Mingkui Tan},
  journal= {arXiv preprint arXiv:2604.21453},
  year   = {2026}
}

备注

CVPR 2026 Poster