MedPromptX: 面向胸部X光诊断的基于视觉定位的多模态提示
计算机视觉与模式识别
2025-04-17 v4 人工智能
摘要
胸部X光图像常用于预测急性和慢性心肺疾病,但由于电子健康记录(EHR)不完整,将其与结构化临床数据整合的努力面临挑战。本文介绍了MedPromptX,这是首个将多模态大语言模型(MLLM)、少样本提示(FP)和视觉定位(VG)相结合,以整合影像与EHR数据进行胸部X光诊断的临床决策支持系统。我们利用预训练的MLLM来补充缺失的EHR信息,从而全面了解患者的病史。此外,FP减少了对MLLM进行大量训练的必要性,同时有效解决了幻觉问题。然而,确定最佳少样本示例数量并选择高质量候选样本的过程可能很繁琐,但它深刻影响模型性能。因此,我们提出了一种新技术,动态优化少样本数据,以便实时适应新的患者场景。此外,VG缩小了X光图像中的搜索区域,从而增强了对异常情况的识别。我们还发布了MedPromptX-VQA,这是一个新的上下文视觉问答数据集,包含源自MIMIC-IV和MIMIC-CXR-JPG数据库的交错图像和EHR数据。结果证明了MedPromptX的SOTA性能,与基线相比,F1分数提高了11%。代码和数据在https://github.com/BioMedIA-MBZUAI/MedPromptX上公开可用。
引用
@article{arxiv.2403.15585,
title = {MedPromptX: Grounded Multimodal Prompting for Chest X-ray Diagnosis},
author = {Mai A. Shaaban and Adnan Khan and Mohammad Yaqub},
journal= {arXiv preprint arXiv:2403.15585},
year = {2025}
}