中文

面向 Segment Anything Model 的深度指令微调

计算机视觉与模式识别 2024-08-30 v2

摘要

近期,Segment Anything Model (SAM) 已成为多媒体与计算机视觉领域的研究热点,在各种(非)条件图像分割任务中展现出强大且通用的能力。尽管 SAM 能够支持不同类型的分割提示,但我们注意到,与点和框引导的分割相比,它在文本指令任务(例如,指向图像分割 (RIS))上的表现要差得多。在本文中,我们认为深度文本指令微调是缓解其默认轻量级掩码解码器中浅融合方案所致缺陷的关键。为解决此问题,我们为 SAM 提出了两种简单而有效的深度指令微调 (DIT) 方法,一种是端到端的,另一种是逐层的。通过极少的修改,DIT 可以直接将 SAM 的图像编码器转变为独立的视觉-语言学习器,而无需构建另一个深度融合分支,从而最大化其卓越分割能力的收益。在三个极具竞争力的 RIS 基准数据集上的大量实验表明,简单的端到端 DIT 可以大幅提升 SAM 的性能,而逐层 DIT 可以用更少的数据和训练开销将性能进一步提升至 SOTA。我们的代码已发布于:https://github.com/wysnzzzz/DIT。

关键词

引用

@article{arxiv.2404.00650,
  title  = {Deep Instruction Tuning for Segment Anything Model},
  author = {Xiaorui Huang and Gen Luo and Chaoyang Zhu and Bo Tong and Yiyi Zhou and Xiaoshuai Sun and Rongrong Ji},
  journal= {arXiv preprint arXiv:2404.00650},
  year   = {2024}
}