中文

TinySAM 2:面向高效 Track Anything 模型的极致内存压缩

计算机视觉与模式识别 2026-05-19 v1 人工智能

摘要

Segment Anything Model 2 (SAM 2) 是视频分割领域的核心基础模型。它在原始 SAM 模型的基础上引入了记忆库机制,并在半监督视频目标分割与追踪任意目标等任务中展现出卓越性能。然而,SAM 2 多阶段图像编码器和记忆模块复杂的计算特性提高了其在实际应用中部署的门槛。为解决这一问题,我们提出了 TinySAM 2,一种平衡性能与效率的轻量级视频分割模型。首先,引入记忆质量管理机制以选择并保留高信息量的历史帧作为记忆。此外,提出联合时空 token 压缩以降低记忆存储与计算开销。具体而言,在空间域采用平均池化先压缩冗余 token;在时间域,基于 token 级相似性度量在记忆库中跨帧选择信息量大的 token。另外,我们采用 RepViT 作为轻量级图像编码器,进一步减少了模型参数。在 DAVIS 和 SA-V 等具有挑战性的数据集上的大量实验表明,TinySAM 2 仅使用 7% 的记忆 token 和 3% 的训练数据,即达到了 SAM 2.1 90% 的性能。本研究有效缓解了 SAM 2 在参数量、计算负载和部署成本方面的瓶颈,为视频分割模型在设备上的广泛应用提供了一种资源高效的解决方案。

关键词

引用

@article{arxiv.2605.18013,
  title  = {TinySAM 2: Extreme Memory Compression for Efficient Track Anything Model},
  author = {Zhaoyuan Ding and Yijing Yang and Han Shu and Xinghao Chen},
  journal= {arXiv preprint arXiv:2605.18013},
  year   = {2026}
}

备注

12 pages, 6 figures