SGDViT:面向无人机跟踪的显著性引导动态视觉Transformer
计算机视觉与模式识别
2023-03-09 v1 机器人学
摘要
基于视觉的目标跟踪推动了无人机的广泛自主应用。然而,无人机跟踪中遇到的飞行机动与视角的动态变化带来了显著困难,例如长宽比变化和尺度变化。传统的互相关操作虽被广泛使用,但在有效捕捉感知相似度及纳入多余背景信息方面存在局限。为缓解这些局限,本文提出一种新颖的显著性引导动态视觉Transformer(SGDViT)用于无人机跟踪。所提方法设计了一种新的任务专用目标显著性挖掘网络,以精炼互相关操作并有效区分前景与背景信息。此外,显著性自适应嵌入操作基于初始显著性动态生成token,从而降低Transformer架构的计算复杂度。最后,轻量级显著性过滤Transformer进一步精炼显著性信息并增强对外观信息的关注。所提方法的有效性与鲁棒性已通过在三个广泛使用的无人机跟踪基准及真实场景中的实验得到充分评估,结果证明了其优越性。源代码与演示视频见 https://github.com/vision4robotics/SGDViT。
引用
@article{arxiv.2303.04378,
title = {SGDViT: Saliency-Guided Dynamic Vision Transformer for UAV Tracking},
author = {Liangliang Yao and Changhong Fu and Sihang Li and Guangze Zheng and Junjie Ye},
journal= {arXiv preprint arXiv:2303.04378},
year = {2023}
}