中文

MedVisionLlama:利用预训练大语言模型层提升医学图像分割

图像与视频处理 2025-08-20 v3 计算与语言 计算机视觉与模式识别

摘要

大语言模型(LLM)因其在文本数据处理方面的多样性,正越来越多地被用于提高医学图像分割,这是一项对于准确诊断影像至关重要的任务。本研究探索了通过整合预训练 LLM 生成式块来增强面向医学图像分割的 Vision Transformer(ViT)。我们的方法将一个冻结的 LLM 生成式块整合到基于 ViT 的模型编码器中,导致在各种医学影像模态上显著提升分割性能。我们提出了一种混合注意力机制,结合全局和局部特征学习,以及一种多尺度融合块用于跨不同尺度特征的聚合。增强后的模型显示出显著的性能提升,平均 Dice 评分从 0.74 提升至 0.79,在准确率、精确率和 Jaccard 指数方面均取得改进。这些结果表明 LLM 基于的生成式在细化医学图像分割方面具有有效性,突显了其在显著提升模型准确性和鲁棒性方面的潜力。源代码和我们的实现均可在:https://github.com/AS-Lab/Marthi-et-al-2025-MedVisionLlama-Pre-Trained-LLM-Layers-to-Enhance-Medical-Image-Segmentation 获取。

关键词

引用

@article{arxiv.2410.02458,
  title  = {MedVisionLlama: Leveraging Pre-Trained Large Language Model Layers to Enhance Medical Image Segmentation},
  author = {Gurucharan Marthi Krishna Kumar and Aman Chadha and Janine Mendola and Amir Shmuel},
  journal= {arXiv preprint arXiv:2410.02458},
  year   = {2025}
}

备注

Accepted to the CVAMD Workshop (Computer Vision for Automated Medical Diagnosis) at the 2025 IEEE/CVF International Conference on Computer Vision (ICCVW 2025)