中文

面向胃肠镜的高效视觉语言模型:医学图像生成与临床视觉问答

计算机视觉与模式识别 2026-05-26 v1 人工智能

摘要

胃肠镜 AI 系统的主要局限性源于标注数据不足、严格的隐私政策以及传统模型微调的显著瓶颈。这些限制阻碍了复杂 AI 模型在临床实践中的成功应用,尤其影响了诊断的可靠性和可扩展性。本文提出一种双管线 PEFT 模型,以解决两个根本问题:医学视觉问答(VQA)和生成隐私保留的合成数据。对于临床 VQA,我们采用 Florence-2 视觉语言模型。通过 PEFT 可增强模型可解释性,同时大幅降低训练计算成本。同时,我们采用 Low-Rank Adaptation(LoRA)与 Stable Diffusion 2.1 结合,用于生成高质量的胃肠镜图像,增强训练数据库而不违反患者隐私。本研究采用 Kvasir-VQA 数据集。我们的 Florence-2 VQA 模型实现了 ROUGE-1 为 0.92,ROUGE-L 为 0.91,BLEU 分数从0.08提升至0.24。在私有数据集上进行的微调始终优于在公开数据集上进行的微调。采用秩为4的 LoRA 合成实现了最佳性能,FID 为 0.290,一致性分为 0.730,Frechet BiomedCLIP Distance(FBD)为 1450,计算成本降低近乎90%。该框架提高了 AI 在胃肠镜临床中的潜力。与 FLUX、MSDM 和 Kandinsky 2.2 相比,我们的模型在 FBD 和语义对齐方面表现优异。虽然其他模型在 Fidelity 或 Agreement 上领先,但我们的低 FBD 指示更好的图像-文本一致性。这些结果表明,我们的方法是增强临床 AI 中 VQA 和合成数据生成的稳健解决方案。

关键词

引用

@article{arxiv.2605.24792,
  title  = {Parameter-Efficient VLMs for Gastrointestinal Endoscopy: Medical Image Generation and Clinical Visual Question Answering},
  author = {Ojonugwa Oluwafemi Ejiga Peter and Frederick Akor Ejiga and Fahmi Khalifa and Md Mahmudur Rahman},
  journal= {arXiv preprint arXiv:2605.24792},
  year   = {2026}
}