SAMITE:基于位置提示的SAM2校准记忆用于视觉对象跟踪
计算机视觉与模式识别
2025-07-30 v1
摘要
视觉对象跟踪(VOT)广泛应用于自动驾驶等应用场景,用于持续跟踪视频中的目标。现有方法大致可分为模板匹配方法和自回归方法,其中前者通常忽略跨帧的时间依赖性,后者则倾向于对训练中的目标类别产生偏见,表现出对未知类别的较弱可 generalization。为解决这些问题,一些方法提出将视频基础模型SAM2用于VOT,其中每帧的跟踪结果将被编码为记忆,用于条件化后续帧。然而,现有方法未能克服目标遮挡和干扰的问题,且没有任何措施来拦截跟踪错误的传播。为此,我们提出SAMITE模型,基于SAM2构建,包含额外模块:(1)原型记忆库:我们提出量化每帧跟踪结果的特征层面和位置层面的正确性,并选择最佳帧条件化后续帧。由于被遮挡和干扰对象在特征层面和位置层面不准确,其得分自然较低,可被过滤以拦截错误传播;(2)位置提示生成器:进一步减少干扰因素的影响,我们提出生成位置掩码提示,为目标提供明确的位置线索,从而实现更精确的跟踪。对六个基准进行了广泛实验,表明SAMITE的优越性。代码已公开https://github.com/Sam1224/SAMITE。
引用
@article{arxiv.2507.21732,
title = {SAMITE: Position Prompted SAM2 with Calibrated Memory for Visual Object Tracking},
author = {Qianxiong Xu and Lanyun Zhu and Chenxi Liu and Guosheng Lin and Cheng Long and Ziyue Li and Rui Zhao},
journal= {arXiv preprint arXiv:2507.21732},
year = {2025}
}