中文

推进 AI 驱动的医学图像合成:基于 MedVQA-GI 挑战赛使用 CLIP、微调 Stable Diffusion 与 DreamBooth + LoRA 的见解

计算机视觉与模式识别 2025-08-12 v2 人工智能 机器学习

摘要

MEDVQA-GI 挑战赛致力于将 AI 驱动的文本到图像生成模型整合到医学诊断中,旨在通过合成图像生成增强诊断能力。现有方法主要侧重于静态图像分析,缺乏根据文本描述动态生成医学图像的能力。本研究旨在通过引入一种基于微调生成模型的新方法,从文本描述生成动态、可扩展且精确的图像,从而部分填补这一空白。具体而言,我们的系统集成了微调的 Stable Diffusion 和 DreamBooth 模型以及低秩适应 (LORA) 来生成高保真医学图像。该问题围绕两个子任务,即:图像合成 (IS) 和最佳提示生成 (OPG)。前者通过文本提示创建医学图像,而后者提供在指定类别中生成高质量图像的提示。该研究强调了传统医学图像生成方法的局限性,如手绘草图、受限的数据集、静态流程和通用模型。我们的评估指标显示,Stable Diffusion 在生成高质量、多样化图像方面超越了 CLIP 和 DreamBooth + LORA。具体而言,Stable Diffusion 具有最低的 Fréchet Inception Distance (FID) 分数(单中心 0.099,多中心 0.064,混合 0.067),表明图像质量更高。此外,它具有最高的平均 Inception Score(所有数据集为 2.327),表明具有出色的多样性和质量。这推进了 AI 驱动的医学诊断领域。未来的研究将集中于模型优化、数据集增强以及将这些进展有效应用于临床实践的伦理考量。

关键词

引用

@article{arxiv.2502.20667,
  title  = {Advancing AI-Powered Medical Image Synthesis: Insights from MedVQA-GI Challenge Using CLIP, Fine-Tuned Stable Diffusion, and Dream-Booth + LoRA},
  author = {Ojonugwa Oluwafemi Ejiga Peter and Md Mahmudur Rahman and Fahmi Khalifa},
  journal= {arXiv preprint arXiv:2502.20667},
  year   = {2025}
}