中文

WoLF:面向胸部 X 射线理解的广域大语言模型框架

人工智能 2024-04-01 v3 计算与语言

摘要

在胸部 X 射线(CXR)理解方面,通过现代视觉-语言模型(VLMs)已取得了显著的方法论进展,展现出了令人印象深刻的视觉问答(VQA)与 CXR 报告生成能力。然而,现有的 CXR 理解框架仍存在若干流程上的不足。(1)以往方法仅使用 CXR 报告,对于全面的视觉问答(VQA)而言并不充分,尤其是在需要用药史和既往诊断等额外健康相关数据时。(2)以往方法使用原始 CXR 报告,而这些报告往往结构随意。尽管现代语言模型能够理解各种文本格式,但对报告进行重构以提供更清晰、按解剖结构组织的信息,能够提升其可用性。(3)当前对 CXR-VQA 的评估方法主要强调语言正确性,缺乏对生成答案进行细致评估的能力。在本工作中,为应对上述不足,我们提出了 WoLF——一个面向 CXR 理解的广域大语言模型框架(Wide-scope Large Language Model Framework)。针对问题(1),我们采集患者多方面的记录,用于真实临床场景中的准确诊断。具体而言,我们采用电子健康记录(EHR)来生成适用于 CXR 理解的指令遵循数据。针对问题(2),我们通过基于解剖结构对 CXR 报告中的知识进行解耦,即便在注意力步骤中也通过掩码注意力(masked attention)来增强报告生成性能。针对问题(3),我们引入了一种针对大语言模型能力评估而优化的 AI 评估协议。通过广泛的实验验证,WoLF 在 MIMIC-CXR 数据集上于 VQA 的 AI 评估场域中(平均分最高提升 +9.47%p)以及报告生成的各项指标上(BLEU-1 提升 +7.3%p)均优于其他模型。

关键词

引用

@article{arxiv.2403.15456,
  title  = {WoLF: Wide-scope Large Language Model Framework for CXR Understanding},
  author = {Seil Kang and Donghyun Kim and Junhyeok Kim and Hyo Kyung Lee and Seong Jae Hwang},
  journal= {arXiv preprint arXiv:2403.15456},
  year   = {2024}
}

备注

11 pages main paper, 2 pages supplementary