中文

重新思考基于 SAM 的视觉对象跟踪中的记忆设计

计算机视觉与模式识别 2025-12-30 v1

摘要

记忆已成为现代基于分段框架实现稳健视觉对象跟踪的核心机制。最近基于 Segment Anything Model 2 (SAM2) 的方法,通过细化过去观察的存储与重用方式,展现了强大的性能。然而,现有方法以方法论特定的方式处理记忆限制,使该领域关于记忆设计原则的更广泛理解仍不清晰。此外,如何将这些记忆机制迁移到更强大的下一代基础模型——Segment Anything Model 3 (SAM3)——上也尚不明了。本文提出了一项系统化的关于 SAM-based 视觉对象跟踪的记忆中心研究。我们首先分析典型的 SAM2-based 跟踪器,表明大多数方法主要在如何选择短期记忆帧方面存在差异,同时共享常见的对象中心表示。基于此洞见,我们忠实地在 SAM3 框架中重新实现这些记忆机制,并在十个多样化基准上进行大规模评估,以实现记忆设计独立于骨干网络强度的受控分析。导师我们的经验发现,我们提出了统一的混合记忆框架,显式地将记忆分解为短期外观记忆和长期干扰消除记忆。这种分解使现有记忆策略能够以模块化和原则化的方式集成。广泛的实验结果表明,所提出的框架在 SAM2 和 SAM3 两个骨干网络上,均在长期遮挡、复杂运动和干扰密集场景下一致性地提升了鲁棒性。代码已公开:https://github.com/HamadYA/SAM3_Tracking_Zoo。\textbf{本文为预印本。部分结果正在完善中,可能在后续修订中更新。}

关键词

引用

@article{arxiv.2512.22624,
  title  = {Rethinking Memory Design in SAM-Based Visual Object Tracking},
  author = {Mohamad Alansari and Muzammal Naseer and Hasan Al Marzouqi and Naoufel Werghi and Sajid Javed},
  journal= {arXiv preprint arXiv:2512.22624},
  year   = {2025}
}

备注

\textbf{This is a preprint. Some results are being finalized and may be updated in a future revision.}