中文

知识增强语言模型解读结构化胸部X光检查结果

计算机视觉与模式识别 2025-05-06 v1

摘要

自动化解读胸部X光片(CXR)是一项具有显著提升临床工作流程和患者护理潜力的关键任务。虽然近期在多模态基础模型方面取得了进展,但有效利用大型语言模型(LLM)来解决这一视觉任务仍属未被充分探索的领域。本文引入了CXR-TextInter框架,通过仅依赖来自上游图像分析管道生成的丰富结构化文本表示来 repurposed 强大的文本导向型 LLM,用于CXR解读。我们将集成的医学知识模块纳入该 LLM 导向方法,以增强临床推理能力。为便于训练和评估,我们开发了MediInstruct-CXR数据集,包含结构化图像表示与多样且临床相关的指令-响应示例配对,以及用于全面评估各类解读任务的CXR-ClinEval基准。对CXR-ClinEval上的大规模实验表明,CXR-TextInter在病灶检测、报告生成和视觉问答任务中实现了超越现有多模态基础模型的领先性能。消融研究确认了知识集成模块的关键贡献。此外,由持证胸部放射科医生进行的盲目评估显示,CXR-TextInter生成的临床质量输出受到显著偏好。我们的工作验证了医学图像AI的另一种范式,展示了在视觉信息被有效结构化且领域知识被集成时,如何发挥先进 LLM 能力的潜力。

关键词

引用

@article{arxiv.2505.01711,
  title  = {Knowledge-Augmented Language Models Interpreting Structured Chest X-Ray Findings},
  author = {Alexander Davis and Rafael Souza and Jia-Hao Lim},
  journal= {arXiv preprint arXiv:2505.01711},
  year   = {2025}
}