TS-SAM:针对下游任务微调 Segment-Anything 模型
计算机视觉与模式识别
2024-08-06 v1
摘要
基于适配器的微调技术已被研究用于提高 SAM 在下游任务上的性能,但微调后的 SAM 与领域特定模型之间仍存在显著的性能差距。为缩小这一差距,我们提出了 Two-Stream SAM(TS-SAM)。首先,受参数高效微调(Parameter-Efficient Fine-Tuning, PEFT)中侧网络的启发,我们设计了轻量级卷积侧适配器(Convolutional Side Adapter, CSA),将来自 SAM 的强大特征整合到侧网络训练中,以实现全面特征融合。其次,结合分割任务的特点,我们设计了多尺度细化模块(Multi-scale Refinement Module, MRM)和特征融合解码器(Feature Fusion Decoder, FFD),以保持细节特征和语义特征。在来自三个任务的十个公开数据集上的大量实验表明,TS-SAM 不仅显著优于最近提出的 SAM-Adapter 和 SSOM,而且与 SOTA 领域特定模型性能相当。我们的代码已公开:https://github.com/maoyangou147/TS-SAM。
引用
@article{arxiv.2408.01835,
title = {TS-SAM: Fine-Tuning Segment-Anything Model for Downstream Tasks},
author = {Yang Yu and Chen Xu and Kai Wang},
journal= {arXiv preprint arXiv:2408.01835},
year = {2024}
}