中文

SAM 2++:在任意粒度上跟踪任何目标

计算机视觉与模式识别 2026-05-19 v4

摘要

由于不同任务中目标状态的粒度差异,大多数现有跟踪器针对单一任务进行设计,这限制了其泛化能力,阻止其有效利用多任务训练数据,导致模型设计和参数的冗余。尽管近期的统一视觉模型在某些方面共享部分架构,但通常保留任务特定的接口,忽略了不同粒度背后的共同跟踪原则,留下了真正统一视频跟踪的空白。为统一视频跟踪任务,我们提出了 SAM 2++,一个可以处理不同粒度目标状态的统一框架,包括掩码、边界框和点,通过提示编码、输出解码和记忆表示的集成设计来实现。首先,为了处理不同目标粒度,我们设计了任务特定的提示,将 diverse 任务输入映射到通用提示嵌入中,并引入统一解码器,以无需重新设计整体管道的方式产生通用输出形式的结果。接下来,为了满足记忆匹配——跟踪的核心操作——我们引入任务自适应记忆机制,将不同粒度的记忆统一,同时保留其独特的状态语义,防止完全参数共享导致粒度之间的干扰。最后,我们引入 Tracking-Any-Granularity,即第一个拥有三种粒度丰富注释的大型和多样化视频跟踪数据集。它通过定制的数据引擎进行分阶段人工注释和模型辅助完成,为训练、基准测试和分析统一跟踪模型提供了全面的资源。全面的实验表明,SAM 2++ 在各种不同粒度的跟踪任务中达到了新的状态突破,建立了一个统一且稳健的跟踪框架。

关键词

引用

@article{arxiv.2510.18822,
  title  = {SAM 2++: Tracking Anything at Any Granularity},
  author = {Jiaming Zhang and Cheng Liang and Yichun Yang and Chenkai Zeng and Yutao Cui and Xinwen Zhang and Xin Zhou and Kai Ma and Gangshan Wu and Limin Wang},
  journal= {arXiv preprint arXiv:2510.18822},
  year   = {2026}
}

备注

14 pages