中文

提升胸部X光解读效率的视觉-语言基础模型

计算机视觉与模式识别 2024-12-20 v2 计算与语言

摘要

每年有超过14亿张胸部X光片(CXRs)被拍摄,因其作为初步诊断检查的成本效益。如此规模的放射学研究为简化CXR解读和文档记录提供了重要机会。虽然基础模型是一种有前景的解决方案,但缺乏公开可用的大规模数据集和基准测试抑制了其迭代开发和实际评估。为了克服这些挑战,我们构建了一个大规模数据集(CheXinstruct),并利用它训练了一个视觉-语言基础模型(CheXagent)。我们在新的评估基准(CheXbench)上系统地展示了该模型在八种不同任务类型上的竞争性能。除了技术验证,我们还评估了CheXagent在直接起草放射学报告方面的实际效用。我们与八位放射科医生的临床评估显示,使用CheXagent起草的报告为住院医师节省了36%的时间,而主治医师在编辑住院医师起草的报告与CheXagent起草的报告时,所用时间没有显著差异。CheXagent起草的报告分别在81%和61%的案例中提高了放射科住院医师和主治医师的书写效率,且未损失质量。总体而言,我们证明CheXagent能够有效执行多种CXR解读任务,并有潜力在常规临床工作流程中辅助放射科医生。

关键词

引用

@article{arxiv.2401.12208,
  title  = {A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation},
  author = {Zhihong Chen and Maya Varma and Justin Xu and Magdalini Paschali and Dave Van Veen and Andrew Johnston and Alaa Youssef and Louis Blankemeier and Christian Bluethgen and Stephan Altmayer and Jeya Maria Jose Valanarasu and Mohamed Siddig Eltayeb Muneer and Eduardo Pontes Reis and Joseph Paul Cohen and Cameron Olsen and Tanishq Mathew Abraham and Emily B. Tsai and Christopher F. Beaulieu and Jenia Jitsev and Sergios Gatidis and Jean-Benoit Delbrouck and Akshay S. Chaudhari and Curtis P. Langlotz},
  journal= {arXiv preprint arXiv:2401.12208},
  year   = {2024}
}

备注

26 pages, 8 figures