中文

面向复杂非线性视觉对象跟踪的空间、几何与语义适应式分段技术

计算机视觉与模式识别 2026-05-22 v1

摘要

传统视觉对象跟踪(VOT)方法通常依赖于任务特定的监督训练,限制了其对未见对象及含有干扰物、遮挡和非线性运动的挑战场景的泛化能力。近期视觉基础模型,以 SAM 2 为代表,学习了来自大规模预训练的强大视频理解先验,为构建更稳健、更通用的跟踪器提供了可前景的基础。然而,直接将 SAM 2 应用于 VOT 仍不够优化,因为它未显式建模目标的运动动态,也未在帧之间强制执行几何和语义一致性——这两者都是可靠跟踪所必需的。为此,我们提出 SAMOSA(Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking),即一个为复杂 VOT 场景量身定制的新型跟踪框架,旨在通过显式地利用运动、几何和语义线索来适配 SAM 2。具体而言,我们引入一个轻量级非线性运动预测器,用于建模目标动态并指导掩码选择以及记忆过滤。我们进一步利用语义线索检测目标位移并从跟踪失败中恢复;同时将几何线索作为结构约束纳入,以提升跟踪稳定性。如此,SAMOSA 桥接了 SAM 2 隐式视频理解先验与显式面向跟踪的建模之间的差距。大量实验表明,SAMOSA 在通用基准上持续超越基于 SAM 2 的最新方法,显示出比监督 VOT 方法更强的泛化能力,并在反 UAV 数据集上实现显著提升,该数据集典型地体现了复杂非线性运动场景。我们的代码已在 https://github.com/DurYi/SAMOSA 提供。

关键词

引用

@article{arxiv.2605.22538,
  title  = {Segment Anything with Motion, Geometry, and Semantic Adaptation for Complex Nonlinear Visual Object Tracking},
  author = {Deyi Zhu and Yuji Wang and Yong Liu and Yansong Tang and Bingyao Yu and Jiwen Lu and Jie Zhou},
  journal= {arXiv preprint arXiv:2605.22538},
  year   = {2026}
}