ClassWise-SAM-Adapter:参数高效微调使 Segment Anything 适配 SAR 域以进行语义分割
计算机视觉与模式识别
2024-01-05 v1
摘要
在人工智能领域,依托强大计算能力和海量数据的基础模型的出现具有革命性意义。Segment Anything Model (SAM) 基于 Vision Transformer (ViT) 模型构建,拥有数百万参数和庞大的训练数据集 SA-1B,凭借其对语义信息的重要性和泛化能力,在各种分割场景中表现出色。视觉基础模型的这一成就激发了对计算机视觉特定下游任务的持续研究。ClassWise-SAM-Adapter (CWSAM) 旨在将高性能的 SAM 适配于星载合成孔径雷达 (SAR) 图像的土地覆盖分类。提出的 CWSAM 冻结了 SAM 的大部分参数,并 Incorporates 轻量级适配器以实现参数高效微调,同时设计了类掩码解码器以完成语义分割任务。这种适配微调方法实现了 SAR 图像的高效土地覆盖分类,平衡了精度与计算需求。此外,特定任务输入模块通过基于 MLP 的层注入 SAR 图像的低频信息,以提升模型性能。与传统的先进语义分割算法相比,大量实验表明 CWSAM 以更少的计算资源展现了增强的性能,突显了利用 SAM 等基础模型处理 SAR 领域特定下游任务的潜力。源代码地址:https://github.com/xypu98/CWSAM。
引用
@article{arxiv.2401.02326,
title = {ClassWise-SAM-Adapter: Parameter Efficient Fine-tuning Adapts Segment Anything to SAR Domain for Semantic Segmentation},
author = {Xinyang Pu and Hecheng Jia and Linghao Zheng and Feng Wang and Feng Xu},
journal= {arXiv preprint arXiv:2401.02326},
year = {2024}
}