中文

多模态大语言模型在胸部X光片分析中应用:处理不完整上下文信息

图像与视频处理 2024-10-10 v1 计算与语言 计算机视觉与模式识别

摘要

背景:大语言模型(LLM)正在临床中获得应用,但其性能在胸部X光片报告不完整时可能受到影响。我们测试了多模态 LLM(使用文本和图像)是否能提高准确性和理解力,使其更适用于临床决策支持。目的:评估 LLM 在使用不完整数据和多模态数据生成胸部X光片报告印象时,其鲁健性。材料与方法:我们使用 MIMIC-CXR 数据库中的 300 对影像-报告配对。测试了三种 LLM(OpenFlamingo、MedFlamingo、IDEFICS),分别以文本唯一和多模态格式进行测试。首先从完整文本生成印象,然后通过删除 20%、50% 和 80% 的文本进行测试。评估添加图像的影响,并使用三个指标进行比较和统计分析。结果:文本唯一模型(OpenFlamingo、MedFlamingo、IDEFICS)表现相似(ROUGE-L: 0.39 vs. 0.21 vs. 0.21;F1RadGraph: 0.34 vs. 0.17 vs. 0.17;F1CheXbert: 0.53 vs. 0.40 vs. 0.40),OpenFlamingo 在完整文本上表现最佳(p<0.001)。所有模型在不完整数据上表现均下降。然而,添加图像显著提升了 MedFlamingo 和 IDEFICS 的性能(p<0.001),甚至超过 OpenFlamingo,尽管文本不完整。结论:LLM 在不完整放射学数据上可能产生低质量输出,但多模态 LLM 可提高可靠性并支持临床决策。

关键词

引用

@article{arxiv.2410.07111,
  title  = {Utility of Multimodal Large Language Models in Analyzing Chest X-ray with Incomplete Contextual Information},
  author = {Choonghan Kim and Seonhee Cho and Joo Heung Yoon},
  journal= {arXiv preprint arXiv:2410.07111},
  year   = {2024}
}