面向实时无人机跟踪的学习式遮挡鲁棒视觉变换器
计算机视觉与模式识别
2025-04-15 v1
摘要
单流架构使用视觉变换器(ViT)作为 backbone 最近在实时无人机跟踪中展现出巨大潜力。然而,来自建筑物和树木等障碍物的频繁遮挡暴露了其主要短板:这些模型往往缺乏有效处理遮挡的策略。亟需新方法来增强单流 ViT 模型在航空跟踪中的遮挡鲁棒性。本文提出基于 ViT 学习遮挡鲁棒表征(ORR),通过对目标在随机遮罩操作下的特征表征施加不变性来实现,该遮罩操作由空间 Cox 过程建模。希望此随机遮罩大致模拟目标遮挡,从而使我们能够学习面向无人机跟踪的遮挡鲁棒 ViT。该框架称为 ORTrack。此外,为促进实时应用,我们提出了自适应基于特征的知识蒸馏(AFKD)方法,以创建更紧凑的跟踪器。该学生模型称为 ORTrack-D,虽保持了 ORTrack 大部分性能,却提供了更高的效率。广泛的实验在多个基准数据集上验证了方法的有效性,显示其实现了最佳的性能。代码已公开于 https://github.com/wuyou3474/ORTrack。
引用
@article{arxiv.2504.09228,
title = {Learning Occlusion-Robust Vision Transformers for Real-Time UAV Tracking},
author = {You Wu and Xucheng Wang and Xiangyang Yang and Mengyuan Liu and Dan Zeng and Hengzhou Ye and Shuiwang Li},
journal= {arXiv preprint arXiv:2504.09228},
year = {2025}
}