重新审视指代多目标跟踪中的两阶段指代跟踪范式:使其再次强大
计算机视觉与模式识别
2026-03-12 v5
摘要
指代多目标跟踪(RMOT)旨在跟踪视频中由自然语言表达式指定的多个目标。随着近期单阶段方法取得显著进展,两阶段的指代跟踪(RBT)范式逐渐失去了其流行度。然而,其较低的训练成本和灵活的增量部署仍然不可替代。重新审视现有的两阶段 RBT 框架,我们发现了两个基本局限:过于启发式的特征构建和脆弱的对应建模。为了解决这些问题,我们提出了 FlexHook,一个新颖的两阶段 RBT 框架。在 FlexHook 中,提出的条件钩子(C-Hook)通过基于采样的策略和语言条件化的线索注入重新定义了特征构建。然后,我们引入了成对对应解码器(PCD),它用主动对应建模取代了基于 CLIP 的相似度匹配,产生了一种更灵活、更鲁棒的策略。在多个基准测试(Refer-KITTI/v2、Refer-Dance 和 LaMOT)上的大量实验表明,FlexHook 成为首个全面超越当前最先进方法的两阶段 RBT 方法。代码可在 https://github.com/buptLwz/FlexHook 找到。
引用
@article{arxiv.2503.07516,
title = {Rethinking Two-Stage Referring-by-Tracking in Referring Multi-Object Tracking: Make it Strong Again},
author = {Weize Li and Yunhao Du and Qixiang Yin and Zhicheng Zhao and Fei Su},
journal= {arXiv preprint arXiv:2503.07516},
year = {2026}
}
备注
Accepted to the CVPR 2026