中文

Rad-VLSM:基于语义辅助提示的医学分割与诊断的跨模态框架

计算机视觉与模式识别 2026-05-19 v1

摘要

医学图像分割在支持诊断而不仅仅是产生病灶掩模时更具临床价值。然而,诊断相关的病灶线索往往微弱且局部化,而现有模型可能受到背景组织、声学伪影和无关视觉相关性的干扰。为此,我们提出了 Rad-VLSM,一个用于语义辅助病灶聚焦、稳健分割和视觉依据诊断的两阶段跨模态框架。在第一阶段,基于 BLIP-2 的视觉语言对齐模块在语义指导下识别病灶相关候选区域并将其转换为框提示。在第二阶段,这些提示被输入基于 SAM 的多任务网络,其中多候选区域聚合策略提高了提示稳定性并引导病灶分割。预测的掩模随后用作诊断的空间先验,视觉-放射组学融合头整合了病灶感知的视觉特征与所选放射组学描述。通过使用语义信息进行局部分析而非直接预测,Rad-VLSM 减少了文本到诊断的依赖,并将诊断锚定在病灶级别。在私人临床乳腫超声数据集和公共基准数据集上的实验表明,Rad-VLSM 在具有良好泛化性的分割和诊断性能方面表现优异。

关键词

引用

@article{arxiv.2605.18130,
  title  = {Rad-VLSM: A Cross-Modal Framework with Semantics-Assisted Prompting for Medical Segmentation and Diagnosis},
  author = {Fengyi Zhang and Xujie Zeng and Mohan Liu and Zengyi Wang and Yalong Jiang},
  journal= {arXiv preprint arXiv:2605.18130},
  year   = {2026}
}