面向 Segment Anything 模型的自动化提示生成与掩码校准
计算机视觉与模式识别
2026-01-21 v1 机器学习
摘要
Segment Anything Model (SAM) 因其多功能能力和卓越性能在语义分割领域获得了广泛关注。尽管如此,SAM 仍面临两个主要局限性:(1) 依赖严格的人工提供的提示(如关键点、边界框或文本消息),这需要大量人力; (2) 掩码解码器的特征表示有时不够准确,因其仅在掩码解码器末端采用点积运算,未能充分捕获精确分割所需的特征关联。现有解决方案(如微调 SAM)通常需要重新训练大量参数,耗时且计算资源巨大。为此,我们提出一种基于双层优化框架的自动化提示生成与掩码校准方法,称为 AM-SAM。该方法自动为输入图像生成提示,无需人工参与,即可在早期训练阶段实现良好性能,加快收敛速度。此外,我们冻结 SAM 的主体部分,对掩码解码器采用低秩适应 (LoRA) 进行修改,通过超越简单点积运算的先进技术来增强掩码解码器的特征表示,从而更准确地捕获和利用特征关联。实验结果表明,AM-SAM 实现了显著精确的分割,匹配或超过人工生成和默认提示的效果。在身体分割数据集上,本方法在仅使用 4 个样本的 few-shot 训练下,以 5% 更高的 dice 分数超越 SOTA 方法,凸显其在语义分割任务中的优势。
引用
@article{arxiv.2410.09714,
title = {AM-SAM: Automated Prompting and Mask Calibration for Segment Anything Model},
author = {Yuchen Li and Li Zhang and Youwei Liang and Pengtao Xie},
journal= {arXiv preprint arXiv:2410.09714},
year = {2026}
}