ChestGPT:集成大语言模型与视觉变换器用于胸部X光片疾病检测与定位
计算机视觉与模式识别
2025-11-11 v2
摘要
全球放射科医生需求正在快速增长,由于对医学影像服务的日益依赖,而放射科医生的供应量未能跟上。计算机视觉和图像处理技术的进展为弥补这一差距、增强放射科医生的能力并提高诊断准确性提供了显著潜力。大语言模型(LLM),特别是生成式预训练变换器(GPT),已成为理解和生成文本数据的主要方法。与此同时,视觉变换器(ViT)已被证明在将视觉数据转换为LLM能够高效处理的格式方面效果显著。在本文中,我们提出了ChestGPT,一种深度学习框架,将EVA ViT与 Llama 2 LLM 集成,用于对胸部X光片图像进行疾病分类和感兴趣区域定位。ViT将X光图像转换为标记,随后与经过人工设计的提示一起输入LLM,从而实现疾病的联合分类和定位。该方法包含迁移学习技术,以增强可解释性和性能。该方法在VinDr-CXR数据集上实现了强大的全球疾病分类性能,F1得分为0.76,并成功地通过在兴趣区域周围生成边界框来定位病灶。我们还概述了几种特定于任务的提示,除了通用提示外,也适用于放射科医生可能遇到的场景。总体而言,该框架提供了一种可减轻放射科医生工作负担的辅助工具,通过提供初步发现和感兴趣区域来促进其诊断过程。
引用
@article{arxiv.2507.03739,
title = {ChestGPT: Integrating Large Language Models and Vision Transformers for Disease Detection and Localization in Chest X-Rays},
author = {Shehroz S. Khan and Petar Przulj and Ahmed Ashraf and Ali Abedi},
journal= {arXiv preprint arXiv:2507.03739},
year = {2025}
}
备注
8 pages, 5 figures, 4 tables