中文

MedBLIP:针对医学图像描述微调 BLIP 模型

图像与视频处理 2025-05-22 v1 人工智能 计算机视觉与模式识别

摘要

医学图像描述是一项具有挑战性的任务,需生成临床上准确且语义富含意义的放射学图像描述。虽然近期出现的视觉语言模型(VLM)如 BLIP、BLIP2、Gemini 和 ViT-GPT2 在自然图像数据集上表现优异,但在应用到专业医学领域时常生成通用或不精确的描述。本项目探索了在 ROCO 数据集上对 BLIP 模型进行领域特定微调,以提升放射学图像描述能力。我们将微调后的 BLIP 与其零样本版本、BLIP-2 base、BLIP-2 Instruct 以及 ViT-GPT2 变压器基线进行比较。我们的结果表明,对 BLIP 进行领域特定微调在定量和定性评估指标上均显著提升了性能。我们还可视化解码器的跨注意力图以评估可解释性,并进行消融研究以评估仅微调编码器和仅微调解码器的贡献。我们的发现突显了针对医疗应用进行有针对性的适配的重要性,表明解码器-only 微调(编码器冻结)作为基线可实现约 5% 的训练时间缩短,而完整模型微调仍整体上获得最佳结果。

关键词

引用

@article{arxiv.2505.14726,
  title  = {MedBLIP: Fine-tuning BLIP for Medical Image Captioning},
  author = {Manshi Limbu and Diwita Banerjee},
  journal= {arXiv preprint arXiv:2505.14726},
  year   = {2025}
}