中文

面向自动胸片解读的视觉语言模型:利用 ViT 和 GPT-2

计算机视觉与模式识别 2025-01-22 v1

摘要

放射科学在现代医学中发挥着关键作用,因其非侵入性的诊断能力。然而,手动生成非结构化的医学报告耗时且容易出错,这在临床工作流程中造成了显著的瓶颈。尽管人工智能生成放射科学报告取得了进展,但在实现详细且准确的报告生成方面仍面临挑战。本研究评估了不同组合的多模态模型,这些模型集成了计算机视觉和自然语言处理,用于生成全面的放射科学报告。我们采用预训练的视觉转换器(ViT-B16)和 SWIN 转换器作为图像编码器。BART 和 GPT-2 模型作为文本解码器。我们使用来自 IU-Xray 数据集的胸片图像和报告来评估 SWIN 转换器-BART、SWIN 转换器-GPT-2、ViT-B16-BART 和 ViT-B16-GPT-2 四个模型用于报告生成的可用性。我们旨在寻找这些模型中最佳的组合。SWIN-BART 模型在四个模型中表现最佳,几乎在所有评估指标(如 ROUGE、BLEU 和 BERTScore)上都取得了显著的成绩。

关键词

引用

@article{arxiv.2501.12356,
  title  = {Vision-Language Models for Automated Chest X-ray Interpretation: Leveraging ViT and GPT-2},
  author = {Md. Rakibul Islam and Md. Zahid Hossain and Mustofa Ahmed and Most. Sharmin Sultana Samu},
  journal= {arXiv preprint arXiv:2501.12356},
  year   = {2025}
}

备注

Preprint, manuscript under-review