中文

SAMannot:基于 SAM2 的内存高效、本地化、开源交互式视频实例分割框架

计算机视觉与模式识别 2026-04-22 v2

摘要

当前精确视频分割的研究工作流往往不得不在费力的手工标注、昂贵的商业平台和/或存在隐私隐患的云端服务之间妥协。研究中对高保真视频实例分割的需求常受制于手工标注的瓶颈与云端工具的隐私问题。我们提出 SAMannot,一个开源的本地化框架,将 Segment Anything Model 2 (SAM2) 集成至人机协同工作流中。为应对基础模型的高资源需求,我们修改了 SAM2 依赖并实现了一个处理层,以最小化计算开销并最大化吞吐量,从而确保高度响应的用户界面。关键特性包括持久的实例身份管理、带有屏障帧的自动化“锁定与精修”工作流,以及基于掩膜骨架化的自动提示机制。SAMannot 便于生成 YOLO 与 PNG 格式的研究就绪数据集,并附带结构化交互日志。通过动物行为追踪用例及 LVOS 和 DAVIS 基准数据集子集验证,该工具为复杂视频标注任务提供了一种可扩展、保护隐私且具成本效益的商业平台替代方案。

关键词

引用

@article{arxiv.2601.11301,
  title  = {SAMannot: A Memory-Efficient, Local, Open-source Framework for Interactive Video Instance Segmentation based on SAM2},
  author = {Gergely Dinya and András Gelencsér and Krisztina Kupán and Clemens Küpper and Kristóf Karacs and Anna Gelencsér-Horváth},
  journal= {arXiv preprint arXiv:2601.11301},
  year   = {2026}
}