中文

Efficient-SAM2:基于对象感知视觉编码与记忆检索加速 SAM2

计算机视觉与模式识别 2026-02-11 v2

摘要

Segment Anything Model 2(SAM2)在视频目标分割任务中表现优异;然而,其沉重的计算负担阻碍了其在实时视频处理中的应用。虽然已有工作努力改善 SAM2 的效率,但大多聚焦于重新训练轻量化 backbone,对后训练加速的探索寥寥。本文我们注意到 SAM2 呈现类似生物视觉的稀疏感知模式,这为消除冗余计算和加速提供了机会:i) 在掩码解码器中,注意力主要集中在前景目标上,而图像编码器在早期阶段具有更广泛的注意范围,导致对背景区域进行不必要的计算。ii) 在记忆库中,仅每个帧中极小子集的 token 对记忆注意力有显著贡献,且显著区域在时间上具有一致性,使得完整 token 计算冗余。基于这些洞见,我们提出了 Efficient-SAM2,通过自适应聚焦对象区域消除与任务无关的计算,从而显著提升推理效率。具体而言,对于图像编码器,我们提出了基于对象感知的稀疏窗口路由(SWR)机制,利用前帧解码器的一致性和显著性线索将背景区域路由到轻量化旁路分支。此外,对于记忆注意力,我们提出了对象感知的稀疏记忆检索(SMR),仅允许每个帧中显著记忆 token 参与计算,并复用其首次检索时的显著性模式。虽然额外参数几乎为零,训练开销也很小,Efficient-SAM2 在 SAM2.1-L 模型上实现 1.68 倍加速,仅在 SA-V 测试集上降低 1.0% 的准确率。

关键词

引用

@article{arxiv.2602.08224,
  title  = {Efficient-SAM2: Accelerating SAM2 with Object-Aware Visual Encoding and Memory Retrieval},
  author = {Jing Zhang and Zhikai Li and Xuewen Liu and Qingyi Gu},
  journal= {arXiv preprint arXiv:2602.08224},
  year   = {2026}
}

备注

ICLR 2026,Code is available at: https://github.com/jingjing0419/Efficient-SAM2