中文

ClipSAM:CLIP与SAM协同实现零样本异常分割

计算机视觉与模式识别 2024-01-30 v2 人工智能

摘要

近期,CLIP和SAM等基础模型在零样本异常分割(ZSAS)任务中展现出令人期待的性能。然而,无论是基于CLIP还是基于SAM的ZSAS方法,仍然存在不可忽视的关键缺陷:1)CLIP主要关注不同输入之间的全局特征对齐,导致对局部异常部分的分割不精确;2)SAM在没有适当提示约束的情况下,倾向于生成大量冗余掩码,导致复杂的后处理需求。在这项工作中,我们创新性地提出了一个名为ClipSAM的CLIP与SAM协同框架,用于ZSAS。ClipSAM背后的洞见是利用CLIP的语义理解能力进行异常定位和粗略分割,并将其进一步用作SAM的提示约束,以细化异常分割结果。具体而言,我们引入了一个关键的统一多尺度跨模态交互(UMCI)模块,用于在CLIP的多个尺度上交互语言与视觉特征,以推理异常位置。然后,我们设计了一个新颖的多级掩码细化(MMR)模块,该模块利用位置信息作为SAM的多级提示,以获取分层级的掩码并将其合并。大量实验验证了我们方法的有效性,在MVTec-AD和VisA数据集上取得了最优的分割性能。

关键词

引用

@article{arxiv.2401.12665,
  title  = {ClipSAM: CLIP and SAM Collaboration for Zero-Shot Anomaly Segmentation},
  author = {Shengze Li and Jianjian Cao and Peng Ye and Yuhan Ding and Chongjun Tu and Tao Chen},
  journal= {arXiv preprint arXiv:2401.12665},
  year   = {2024}
}

备注

17 pages,17 figures