EfficientSAM3:基于 SAM1、2、3 的渐进式层次蒸馏用于视频概念分割
计算机视觉与模式识别
2025-11-21 v1 人工智能
摘要
Segment Anything Model 3 (SAM3) 通过可提示概念分割 (PCS) 推进图像和视频的视觉理解,但其统一架构 (共享视觉 backbone、DETR 式检测器、稠密记忆跟踪器) 对于设备端使用仍不实用。我们提出 EfficientSAM3,一组基于渐进式层次蒸馏 (PHD) 构建的高效模型,将 SAM3 的能力传递给轻量级学生,分为三个阶段:(1) 编码器蒸馏在 SA-1B 上通过带提示的循环训练对齐图像特征;(2) 时间记忆蒸馏用紧凑的 Perceiver 基于模块取代稠密记忆,在 SA-V 上压缩和检索时空特征;(3) 端到端微调在官方 SAM3 PCS 数据集上完成,以保持概念层次性能。PHD 产生一系列学生变体,使用 RepViT、TinyViT 和 EfficientViT backbone,实现设备端概念分割和跟踪,同时保持对教师行为的高保真。我们在流行的 VOS 数据集上进行基准测试,并与各种相关工作进行比较,实现了强大的性能-效率权衡。
引用
@article{arxiv.2511.15833,
title = {EfficientSAM3: Progressive Hierarchical Distillation for Video Concept Segmentation from SAM1, 2, and 3},
author = {Chengxi Zeng and Yuxuan Jiang and Aaron Zhang},
journal= {arXiv preprint arXiv:2511.15833},
year = {2025}
}
备注
Github: https://github.com/SimonZeng7108/efficientsam3