面向实时无人机跟踪的自适应和视角不变视觉 Transformer 学习
计算机视觉与模式识别
2025-08-18 v3
摘要
Transformer 模型已改进视觉跟踪,但大多数模型仍无法在资源受限的设备上实时运行,尤其是对于无人机(UAV)跟踪。为在性能和效率之间取得更好的平衡,我们提出了 AVTrack,一种自适应计算跟踪框架,通过激活模块(AM)自适应激活 Transformer 块,动态优化 ViT 架构,仅选择性地激活相关组件。为解决极端视角变化问题,我们提出通过互信息(MI)最大化学习视角不变表示。此外,我们提出了 AVTrack-MD,一种集成了新型 MI 最大化多教师知识蒸馏框架的增强型跟踪器。利用多个现成的 AVTrack 模型作为教师,我们最大化其聚合软化特征与学生模型对应软化特征之间的 MI,从而提高学生模型的泛化性和性能,尤其在噪声条件下。大量实验表明,AVTrack-MD 在保持与 AVTrack 相当性能的同时,减少了模型复杂度,将平均跟踪速度提升了 17% 以上。代码已公开:https://github.com/wuyou3474/AVTrack。
引用
@article{arxiv.2412.20002,
title = {Learning an Adaptive and View-Invariant Vision Transformer for Real-Time UAV Tracking},
author = {You Wu and Yongxin Li and Mengyuan Liu and Xucheng Wang and Xiangyang Yang and Hengzhou Ye and Dan Zeng and Qijun Zhao and Shuiwang Li},
journal= {arXiv preprint arXiv:2412.20002},
year = {2025}
}