中文

用单样本个性化 Segment Anything Model

计算机视觉与模式识别 2023-10-05 v2 人工智能 计算与语言 机器学习 多媒体

摘要

在大数据预训练的驱动下,Segment Anything Model(SAM)已被证明是一个强大且可提示的框架,革新了分割模型。尽管具有通用性,但在无人工提示的情况下为特定视觉概念定制 SAM 仍未被充分探索,例如在不同图像中自动分割你的宠物狗。本文中,我们提出一种免训练的 SAM 个性化方法,称为 PerSAM。仅给定单张带参考掩码的图像,PerSAM 首先通过位置先验定位目标概念,并通过三种技术在其他图像或视频中分割它:目标引导注意力、目标语义提示与级联后精炼。以此方式,我们无需任何训练即可有效将 SAM 适配于私人使用。为进一步缓解掩码歧义,我们提出一种高效单样本微调变体 PerSAM-F。冻结整个 SAM,我们为多尺度掩码引入两个可学习权重,仅在 10 秒内训练 2 个参数以提升性能。为证明有效性,我们构建了新分割数据集 PerSeg 用于个性化评估,并在视频目标分割上测试了我们的方法,取得有竞争力的性能。此外,我们的方法还能增强 DreamBooth 以个性化 Stable Diffusion 用于文本到图像生成,其摒弃背景干扰以更好地学习目标外观。代码发布于 https://github.com/ZrrSkywalker/Personalize-SAM

关键词

引用

@article{arxiv.2305.03048,
  title  = {Personalize Segment Anything Model with One Shot},
  author = {Renrui Zhang and Zhengkai Jiang and Ziyu Guo and Shilin Yan and Junting Pan and Xianzheng Ma and Hao Dong and Peng Gao and Hongsheng Li},
  journal= {arXiv preprint arXiv:2305.03048},
  year   = {2023}
}

备注

Code is available at https://github.com/ZrrSkywalker/Personalize-SAM