中文

LoGSAM:面向 MRI 分割的参数高效跨模态定位框架

计算机视觉与模式识别 2026-03-30 v2

摘要

对于使用磁共振成像 (MRI) 的脑肿瘤精准定位与描绘对于治疗规划和手术决策至关重要。然而,大多数现有方法依赖于特定任务的监督模型,且受限于注释数据的稀缺。为此,我们提出了 LoGSAM,一个参数高效、以检测为导向的框架,将放射科医生的语音指令转化为文本提示,以实现基于基础模型的位置感知与分割。首先,放射科医生的语音经预训练的 Whisper 语音识别模型转录并翻译,随后通过考虑否定情境的临床自然语言处理技术提取肿瘤特定文本提示。这些提示用于引导经 LoRA 适配的视觉-语言检测模型 Grounding DINO 实现文本条件下的肿瘤定位。LoRA 适配仅使用 5% 的模型参数,即可实现计算效率高的领域适应,同时保留预训练的跨模态知识。预测的边界框用作 MedSAM 的提示,用于生成无需额外微调的像素级肿瘤掩码。以 LoGSAM 提供的先验信息为条件的冻结 MedSAM 在 BRISC 2025 数据集上实现了最高 80.32% 的 Dice 评分。此外,我们在德国放射科医生的语音指令上,对 12 例未见的 MRI 扫描进行了完整管线评估,实现了 91.7% 的案例级准确率。这些结果凸显了通过智能利用预训练基础模型并进行最小参数更新,构建模块化语音到分割管道的可行性。

关键词

引用

@article{arxiv.2603.17576,
  title  = {LoGSAM: Parameter-Efficient Cross-Modal Grounding for MRI Segmentation},
  author = {Mohammad Robaitul Islam Bhuiyan and Sheethal Bhat and Melika Qahqaie and Tri-Thien Nguyen and Paula Andrea Perez-Toro and Tomas Arias-Vergara and Andreas Maier},
  journal= {arXiv preprint arXiv:2603.17576},
  year   = {2026}
}

备注

10 pages, 3 figures