CC-SAM:基于跨特征注意力与上下文信息的医用超声图像分割模型
计算机视觉与模式识别
2024-08-02 v1
摘要
Segment Anything Model(SAM)在自然图像分割领域取得了显著成功,但在医学影像领域的应用面临挑战。具体而言,该模型在处理低对比度、模糊边界、复杂形态和小尺寸物体的医学图像时表现不佳。为解决这些问题并提升 SAM 在医学领域的性能,我们提出了全面的改进方案。首先,我们引入一个冻结的卷积神经网络(CNN)分支作为图像编码器,通过一种新颖的变分注意力融合模块将其与 SAM 原始的 Vision Transformer(ViT)编码器集成。这一集成增强了模型捕获局部空间信息的能力,这在医学影像中往往至关重要。此外,为进一步优化 SAM 以适应医学影像,我们在 ViT 分支中引入特征和位置适配器,以细化编码器的表征。我们发现,与当前用于微调 SAM 以实现超声医学分割的提示策略相比,使用作为文本提示的文本描述能显著提升性能。借助 ChatGPT 的自然语言理解能力,我们生成提供上下文信息和引导性建议的提示,从而使模型更好地理解超声医学图像的细微差别并提高分割精度。整个方法代表了将通用图像分割模型变得更具适应性和在医学领域更高效的重要一步。
引用
@article{arxiv.2408.00181,
title = {CC-SAM: SAM with Cross-feature Attention and Context for Ultrasound Image Segmentation},
author = {Shreyank N Gowda and David A. Clifton},
journal= {arXiv preprint arXiv:2408.00181},
year = {2024}
}
备注
Accepted to ECCV 2024