BA-SAM:用于 Segment Anything Model 的可扩展偏置模式注意力掩码
计算机视觉与模式识别
2024-03-21 v4
摘要
在本文中,我们解决了 Segment Anything Model (SAM) 面临的图像分辨率变化挑战。SAM 以其零样本泛化能力著称,但在面对具有不同图像尺寸的数据集时表现出性能下降。以往的方法倾向于将图像调整为固定大小或采用结构修改,这阻碍了 SAM 丰富先验知识的保留。此外,这种针对特定任务的微调需要对模型进行完全重新训练,成本高昂且不利于下游任务的部署。在本文中,我们将此问题重新表述为长度外推问题,即在保持不同尺寸图像的 patch 大小一致的同时,token 序列长度发生变化。为此,我们提出了可扩展偏置模式注意力掩码(BA-SAM),以增强 SAM 对不同图像分辨率的适应性,同时消除对结构修改的需求。首先,我们引入一个新的缩放因子,以确保在 token 序列长度变化时注意力层点积值的幅度保持一致。其次,我们提出了一种偏置模式注意力掩码,允许每个 token 优先处理邻近信息,从而减轻未训练的远距离信息的影响。我们的 BA-SAM 在零样本和微调两种场景中均显示出有效性。在包括 DIS5K、DUTS、ISIC、COD10K 和 COCO 在内的多样化数据集上的广泛评估表明,它能够显著缓解零样本设置下的性能下降,并以极少的微调实现最先进的性能。此外,我们提出了一个通用模型和基准,展示了 BA-SAM 在所有四个数据集上的同时泛化能力。代码地址:https://github.com/zongzi13545329/BA-SAM
引用
@article{arxiv.2401.02317,
title = {BA-SAM: Scalable Bias-Mode Attention Mask for Segment Anything Model},
author = {Yiran Song and Qianyu Zhou and Xiangtai Li and Deng-Ping Fan and Xuequan Lu and Lizhuang Ma},
journal= {arXiv preprint arXiv:2401.02317},
year = {2024}
}
备注
Accepted to IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024