UniSOT:多模态单目标跟踪的统一框架
计算机视觉与模式识别
2025-11-04 v1 人工智能
摘要
单目标跟踪旨在利用特定的参考模态(边界框、自然语言或两者)在特定的视频模态序列(RGB、RGB+深度、RGB+热红外或RGB+事件)中定位目标对象。不同的参考模态实现了不同的人机交互,而在复杂场景中需要不同的视频模态来增强跟踪鲁棒性。现有的跟踪器是为单一或几种视频模态以及单一或几种参考模态设计的,这导致了分离的模型设计并限制了实际应用。实际上,需要一个统一的跟踪器来处理各种需求。据我们所知,目前还没有跟踪器能够同时使用上述参考模态跨这些视频模态进行跟踪。因此,在本文中,我们提出了一个统一的跟踪器UniSOT,用于三种参考模态和四种视频模态的不同组合,且参数统一。在18个视觉跟踪、视觉-语言跟踪和RGB+X跟踪基准上的大量实验结果表明,UniSOT在性能上优于特定模态的对应方法。值得注意的是,UniSOT在TNL2K数据集上,在所有三种参考模态下,AUC比之前的对应方法高出超过3.0%,并且在所有三种RGB+X视频模态下,主要指标比Un-Track高出超过2.0%。
引用
@article{arxiv.2511.01427,
title = {UniSOT: A Unified Framework for Multi-Modality Single Object Tracking},
author = {Yinchao Ma and Yuyang Tang and Wenfei Yang and Tianzhu Zhang and Xu Zhou and Feng Wu},
journal= {arXiv preprint arXiv:2511.01427},
year = {2025}
}
备注
The paper has been accepted by TPAMI