中文

用于医学图像病灶分割的语言引导尺度感知 MedSegmentor

计算机视觉与模式识别 2025-04-22 v3

摘要

在临床实践中,根据医师需求分割特定病灶可显著提升诊断准确率与治疗效率。然而,传统病灶分割模型缺乏根据特定要求区分病灶的灵活性。鉴于使用文本作为引导的实际优势,我们提出了一种新颖的模型——语言引导尺度感知 MedSegmentor (LSMS),该模型基于给定的文本表达分割医学图像中的目标病灶。我们将此定义为一项新任务,称为指代表达病灶分割 (RLS)。为解决 RLS 缺乏合适基准的问题,我们构建了一个视觉-语言医学数据集,命名为参考肝脏病灶分割 (RefHL-Seg)。LSMS 包含两个关键设计:(i) 尺度感知视觉-语言注意力模块,并行执行视觉特征提取与视觉-语言对齐。该模块利用多样化的卷积核获取丰富的视觉表示,并与语言特征密切交互,从而增强模型精确定位目标的能力。(ii) 全尺度解码器,跨多个尺度对多模态特征进行全局建模,并捕获它们之间的互补信息以准确勾勒病灶边界。此外,我们设计了一个包含分割损失和视觉-语言对比损失的专用损失函数,以更好地优化跨模态学习。我们在多个数据集上验证了 LSMS 在 RLS 以及传统病灶分割任务上的性能。我们的 LSMS 以显著更低的计算成本持续取得卓越的性能。代码和数据集将予发布。

关键词

引用

@article{arxiv.2408.17347,
  title  = {Language-guided Scale-aware MedSegmentor for Lesion Segmentation in Medical Imaging},
  author = {Shuyi Ouyang and Jinyang Zhang and Xiangye Lin and Xilai Wang and Qingqing Chen and Yen-Wei Chen and Lanfen Lin},
  journal= {arXiv preprint arXiv:2408.17347},
  year   = {2025}
}

备注

10 pages, 5 figures