中文

Zeus:多模态医学影像联合分割的零样本大语言模型指令

计算机视觉与模式识别 2025-04-11 v1 人工智能

摘要

医学图像分割通过基于 UNet 和 Transformer 的基础骨干网络的持续进步取得了显著成功。然而,现实世界中的临床诊断通常需要整合领域知识,尤其是文本信息。进行涉及视觉和文本模态的多模态学习是一种解决方案,但收集配对的视觉-语言数据集成本高昂且耗时,带来了重大挑战。受大语言模型(LLM)在众多跨模态任务中卓越能力的启发,我们提出了一种新颖的 Vision-LLM 联合框架来解决这些问题。具体来说,我们引入冻结的 LLM,基于相应的医学图像进行零样本指令生成,模拟放射学扫描和报告生成过程。为了更好地逼近真实诊断过程,我们从多模态放射学图像(例如 T1-w 或 T2-w MRI 和 CT)生成更精确的文本指令。基于 LLM 强大的语义理解和丰富知识,该过程强调从不同模态中提取特殊特征,并重新整合信息以用于最终临床诊断。利用生成的文本指令,我们提出的联合分割框架可以在没有预先收集的视觉-语言数据集的情况下处理多模态分割。为了评估我们提出的方法,我们与有影响力的基线进行了全面实验,统计结果和可视化案例研究证明了我们新方法的优越性。

关键词

引用

@article{arxiv.2504.07336,
  title  = {Zeus: Zero-shot LLM Instruction for Union Segmentation in Multimodal Medical Imaging},
  author = {Siyuan Dai and Kai Ye and Guodong Liu and Haoteng Tang and Liang Zhan},
  journal= {arXiv preprint arXiv:2504.07336},
  year   = {2025}
}

备注

21 pages, 4 figures, In Press by a journal