中文

SOI 是万恶之源:量化并破解单对象跟踪中的相似对象干扰

计算机视觉与模式识别 2025-08-15 v2

摘要

本文提出了对单对象跟踪(SOT)中相似对象干扰(SOI)的首次系统性调查和量化。通过受控的在线干扰遮蔽(OIM)实验,我们定量地表明消除干扰来源可在所有 SOTA 跟踪器上实现显著的性能提升(AUC 提升最高可达4.35),直接验证了 SOI 作为稳健跟踪的主要约束,并凸显了外部认知指导的可行性。基于这些见解,我们采用自然语言作为实际的外部指导,构建了 SOIBench——首个专门针对 SOI 挑战的语义认知指导基准数据集。它通过多跟踪器集体判断自动挖掘 SOI 帧,并引入多级标注协议以生成精确的语义指导文本。在 SOIBench 上的系统评估揭示了惊人的发现:现有的视觉-语言跟踪(VLT)方法未能有效利用语义认知指导,仅实现有限的性能提升甚至出现性能下降(AUC 变化为 -0.26 到 +0.71)。相比之下,我们提出一种新范例,利用大规模视觉-语言模型(VLM)作为外部认知引擎,可无缝集成到任意 RGB 跟踪器中。该方法在语义认知指导下实现了显著的性能提升(AUC 提升最高可达0.93),为现有 VLT 方法带来了重大进展。我们希望 SOIBench 将作为推动语义认知跟踪研究的标准化评估平台,并为跟踪研究社区贡献新的见解。

关键词

引用

@article{arxiv.2508.09524,
  title  = {SOI is the Root of All Evil: Quantifying and Breaking Similar Object Interference in Single Object Tracking},
  author = {Yipei Wang and Shiyu Hu and Shukun Jia and Panxi Xu and Hongfei Ma and Yiping Ma and Jing Zhang and Xiaobo Lu and Xin Zhao},
  journal= {arXiv preprint arXiv:2508.09524},
  year   = {2025}
}