中文

XrayGPT:基于医学视觉-语言模型的胸部X光片摘要生成

计算机视觉与模式识别 2025-05-08 v2

摘要

大视觉-语言模型(如Bard与GPT-4)的最新突破展现出执行广泛任务的卓越能力。此类模型在包含数十亿公开图像-文本对及多样任务的超大规模数据集上训练。然而,它们在放射学等特定任务领域上的性能仍待充分研究,并可能因缺乏理解生物医学图像的精细能力而受限。另一方面,对话式医学模型已取得显著成功,但主要聚焦于基于文本的分析。本文中,我们引入XrayGPT,一种新颖的对话式医学视觉-语言模型,可分析并回答关于胸部X光片的开放式问题。具体而言,我们使用简单的线性变换将医学视觉编码器(MedClip)与微调的大语言模型(Vicuna)对齐。该对齐使我们的模型具备卓越的视觉对话能力,并扎根于对X光片与医学领域知识的深度理解。为提升LLM在医学语境下的表现,我们从自由文本放射学报告中生成约217k条交互式高质量摘要。这些摘要通过微调过程提升LLM性能。我们的方法为推进胸部X光片自动分析的研究开辟了新途径。我们的开源演示、模型与指令集见:https://github.com/mbzuai-oryx/XrayGPT。

关键词

引用

@article{arxiv.2306.07971,
  title  = {XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models},
  author = {Omkar Thawakar and Abdelrahman Shaker and Sahal Shaji Mullappilly and Hisham Cholakkal and Rao Muhammad Anwer and Salman Khan and Jorma Laaksonen and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2306.07971},
  year   = {2025}
}

备注

Accepted at ACL 2024-BIONLP Workshop. Code: https://github.com/mbzuai-oryx/XrayGPT