中文

像放射科医生一样解读胸部 X 光片:一个带有临床推理的基准测试

计算机视觉与模式识别 2025-05-30 v1

摘要

基于人工智能 (AI) 的胸部 X 光片 (CXR) 解读助手已展现出显著进展,并日益应用于临床环境。然而,当代医疗 AI 模型通常遵循简单的输入到输出范式,直接处理图像和指令以生成结果,其中指令可能构成模型架构的一部分。这种方法忽略了对胸部 X 光片解读中固有的诊断推理的建模。此类推理通常是顺序性的,每个解读阶段都会考虑图像、当前任务以及来自先前阶段的上下文信息。这种疏忽导致了若干缺陷,包括与临床场景不一致、缺乏上下文的推理以及无法追踪的错误。为了填补这一空白,我们构建了 CXRTrek,一个用于 CXR 解读的新型多阶段视觉问答 (VQA) 数据集。该数据集首次明确模拟了放射科医生在真实临床环境中采用的诊断推理过程。CXRTrek 涵盖 8 个顺序诊断阶段,包含 428,966 个样本和超过 1100 万个问答 (Q&A) 对,平均每个样本 26.29 个 Q&A 对。基于 CXRTrek 数据集,我们提出了一种新的视觉语言大模型 (VLLM) CXRTrekNet,专门设计用于将临床推理流程纳入 VLLM 框架。CXRTrekNet 有效地建模了诊断阶段之间的依赖关系,并捕获了放射学上下文中的推理模式。在我们的数据集上训练后,该模型在 CXRTrek 基准测试上始终优于现有的医疗 VLLM,并在五个不同的外部数据集上展现出卓越的跨任务泛化能力。数据集和模型可在我们的代码库中找到 (https://github.com/guanjinquan/CXRTrek)。

关键词

引用

@article{arxiv.2505.23143,
  title  = {Interpreting Chest X-rays Like a Radiologist: A Benchmark with Clinical Reasoning},
  author = {Jinquan Guan and Qi Chen and Lizhou Liang and Yuhang Liu and Vu Minh Hieu Phan and Minh-Son To and Jian Chen and Yutong Xie},
  journal= {arXiv preprint arXiv:2505.23143},
  year   = {2025}
}

备注

10 pages (main text), 18 pages (appendix)