中文

ViewSAM:面向弱监督跨视图指代多目标跟踪的视角感知跨模态语义学习

计算机视觉与模式识别 2026-05-05 v1 人工智能

摘要

跨视图指代多目标跟踪(CRMOT)旨在从多个摄像头视图中跟踪由自然语言指定的多个对象,并保持全局一致的身份。尽管近期进展,但现有方法高度依赖昂贵的帧级空间标注和跨视图身份监督。为减少此类依赖,我们探索在弱监督下的 CRMOT,利用基础模型的能力。然而,我们的实证研究表明,直接应用如 SAM2 和 SAM3 的基础模型,即使具备任务特定的修改,也无法准确理解指代表达式并在视图之间保持一致的身份。然而,它们在产生可靠对象 tracklet 方面仍然有效,可作为伪监督。因此,我们将基础模型用作伪标签生成器,提出一个仅使用对象类别标签作为粗粒度监督的两阶段框架进行弱监督 CRMOT。在第一个阶段,我们设计了基于亲和力的跨视图再提示策略,以细化和关联 SAM3 生成的 tracklet 跨摄像机,产生可靠的跨视图伪标签用于后续训练。在第二个阶段,我们引入 ViewSAM,一个基于 SAM2 的 CRMOT 模型,显式地建模视角感知的跨模态语义。通过将视角引起的变异表述为可学习的条件,ViewSAM 在视角变异的视觉观察与视角不变的文本表达式之间搭建了桥梁,实现了仅需约 10% 额外参数的鲁棒跨视图指代跟踪。大量实验表明,ViewSAM 在弱监督下实现了 SOTA 性能,并与 fully 监督方法保持竞争力。

关键词

引用

@article{arxiv.2605.02638,
  title  = {ViewSAM: Learning View-aware Cross-modal Semantics for Weakly Supervised Cross-view Referring Multi-Object Tracking},
  author = {Jiawei Ge and Xintian Zhang and Jiuxin Cao and Bo Liu and Fabian Deuser and Chang Liu and Gong Wenkang and Siyou Li and Juexi Shao and Wenqing Wu and Chen Feng and Ioannis Patras},
  journal= {arXiv preprint arXiv:2605.02638},
  year   = {2026}
}