SDSTrack:面向多模态视觉目标跟踪的自蒸馏对称适配器学习
计算机视觉与模式识别
2024-03-29 v2
摘要
多模态视觉目标跟踪(VOT)因其鲁棒性近期获得了显著关注。早期研究集中于完全微调基于RGB的跟踪器,但由于多模态数据的稀缺,这种方法效率低下且缺乏泛化表示。因此,近期研究利用提示微调将预训练的基于RGB的跟踪器迁移到多模态数据。然而,模态差距限制了预训练知识的召回,并且RGB模态的主导地位持续存在,阻碍了其他模态信息的充分利用。为解决这些问题,我们提出了一种新颖的对称多模态跟踪框架,称为SDSTrack。我们引入轻量级适配以实现高效微调,该适配通过少量可训练参数直接将特征提取能力从RGB域迁移到其他域,并以平衡、对称的方式集成多模态特征。此外,我们设计了一种互补掩码块蒸馏策略,以增强跟踪器在复杂环境(如极端天气、不良成像和传感器故障)中的鲁棒性。大量实验表明,SDSTrack在多种多模态跟踪场景(包括RGB+深度、RGB+热红外和RGB+事件跟踪)中优于最先进的方法,并在极端条件下展现出令人印象深刻的结果。我们的源代码可在https://github.com/hoqolo/SDSTrack获取。
引用
@article{arxiv.2403.16002,
title = {SDSTrack: Self-Distillation Symmetric Adapter Learning for Multi-Modal Visual Object Tracking},
author = {Xiaojun Hou and Jiazheng Xing and Yijie Qian and Yaowei Guo and Shuo Xin and Junhao Chen and Kai Tang and Mengmeng Wang and Zhengkai Jiang and Liang Liu and Yong Liu},
journal= {arXiv preprint arXiv:2403.16002},
year = {2024}
}
备注
Accepted by CVPR2024