中文

SAMURAI:结合运动感知记忆适配 Segment Anything Model 以实现零样本视觉跟踪

计算机视觉与模式识别 2024-12-03 v2

摘要

Segment Anything Model 2 (SAM 2) 在物体分割任务中表现出色,但在视觉目标跟踪中面临挑战,尤其是在处理包含快速移动或自遮挡物体的拥挤场景时。此外,原始模型中的固定窗口记忆方法未考虑用于为下一帧图像特征提供条件所选记忆的质量,导致视频中出现误差传播。本文介绍了 SAMURAI,一种专为视觉目标跟踪设计的 SAM 2 增强适配版本。通过将时序运动线索与所提出的运动感知记忆选择机制相结合,SAMURAI 能够有效预测物体运动并优化掩码选择,无需重新训练或微调即可实现稳健、准确的跟踪。SAMURAI 可实时运行,并在多种基准数据集上展现出强大的零样本性能,证明了其在无需微调情况下的泛化能力。在评估中,SAMURAI 的成功率和精度较现有跟踪器均有显著提升,在 LaSOText_{\text{ext}} 上 AUC 提升 7.1%,在 GOT-10k 上 AO 提升 3.5%。此外,它在 LaSOT 上取得了与全监督方法相当的结果,凸显了其在复杂跟踪场景中的稳健性以及在动态环境中实际应用的潜力。

关键词

引用

@article{arxiv.2411.11922,
  title  = {SAMURAI: Adapting Segment Anything Model for Zero-Shot Visual Tracking with Motion-Aware Memory},
  author = {Cheng-Yen Yang and Hsiang-Wei Huang and Wenhao Chai and Zhongyu Jiang and Jenq-Neng Hwang},
  journal= {arXiv preprint arXiv:2411.11922},
  year   = {2024}
}

备注

Project page is available at https://yangchris11.github.io/samurai/