中文

SLiMe:像我一样分割

计算机视觉与模式识别 2024-03-15 v4 机器学习

摘要

利用 Stable Diffusion(SD)等大型视觉-语言模型在图像编辑、图像对应和 3D 形状生成等多种下游任务中已取得重大进展。受这些进展启发,我们探索利用这些广泛的视觉-语言模型,通过提出 SLiMe,以少至一个标注样本按任意所需粒度分割图像。SLiMe 将这一问题构建为优化任务。具体而言,给定单张训练图像及其分割掩码,我们首先从 SD 先验中提取注意力图,包括我们新颖的“加权累积自注意力图”。然后,利用提取的注意力图,优化 Stable Diffusion 的文本嵌入,使得每一个嵌入从训练图像中学习一个单一的分割区域。这些学习到的嵌入随后在注意力图中突出分割区域,进而可用于导出分割图。这使得 SLiMe 在推理时能用训练图像中分割区域的粒度,仅用一个示例分割任何真实世界图像。此外,在可用时利用额外训练数据(即少样本)可提升 SLiMe 的性能。我们进行了一组知识丰富的实验考察各种设计因素,并表明 SLiMe 优于其他现有的一次性(one-shot)和少样本分割方法。

关键词

引用

@article{arxiv.2309.03179,
  title  = {SLiMe: Segment Like Me},
  author = {Aliasghar Khani and Saeid Asgari Taghanaki and Aditya Sanghi and Ali Mahdavi Amiri and Ghassan Hamarneh},
  journal= {arXiv preprint arXiv:2309.03179},
  year   = {2024}
}