CXR-Agent:基于不确定性感知的胸片X光解读视觉语言模型
图像与视频处理
2024-07-15 v1 计算机视觉与模式识别
摘要
最近,大型视觉语言模型在解读复杂图像并生成自然语言描述方面展现出巨大的潜力。医学 inherently 多模态的特性——将扫描图像与基于文本的医学史相结合来撰写报告——使其能够从这些AI技术的飞跃中获益。我们评估了公开的、最先进的基础视觉语言模型用于胸片X光解读,涵盖多个数据集和基准测试。我们使用线性探针评估 various 组件的性能,包括 CheXagent 的视觉Transformer 和 Q-former,这些模型在许多不同数据集上均优于行业标准的Torch X-ray Vision模型,显示出稳健的泛化能力。重要的是,我们发现视觉语言模型常常以自信的语言进行幻觉,从而减缓临床解读。基于这些发现,我们开发了一种基于 agent 的视觉语言方法,用于生成不确定性感知的放射科报告,利用 CheXagent 的线性探针和 BioViL-T 的短语定位工具,依据病灶出现的概率来局部分析并描述病灶。我们通过开发评估平台进行彻底评估,使用NLP指标、胸片基准测试和由呼吸科专家进行的临床评估。我们的结果显示,在准确性、可解释性和安全性方面,AI生成的报告有显著的改进。我们强调,必须分别分析正常和异常扫描的结果。最后,我们强调需要更大规模的配对(扫描和报告)数据集,以及数据增强,以解决这些大型视觉语言模型中出现的过拟合问题。
引用
@article{arxiv.2407.08811,
title = {CXR-Agent: Vision-language models for chest X-ray interpretation with uncertainty aware radiology reporting},
author = {Naman Sharma},
journal= {arXiv preprint arXiv:2407.08811},
year = {2024}
}
备注
Supervised by Professor Ben Glocker