中文

MAIRA-1:一种用于放射学报告生成的专用大型多模态模型

计算与语言 2024-04-29 v3 人工智能 计算机视觉与模式识别

摘要

我们提出了一种放射学专用的多模态模型,用于从胸部X射线(CXR)生成放射学报告的任务。我们的工作基于这样一个思想:大型语言模型可以通过与预训练视觉编码器对齐而获得多模态能力。在自然图像上,这已被证明可使多模态模型获得图像理解与描述能力。我们提出的模型(MAIRA-1)利用CXR专用图像编码器,结合基于Vicuna-7B微调的大型语言模型以及基于文本的数据增强,生成具有最先进质量的报告。具体而言,MAIRA-1在放射科医生对齐的RadCliQ指标以及所考虑的所有词汇指标上均显著提升。对模型输出的手动审查显示出生成报告具有令人满意的流畅性与准确性,同时也揭示了现有评估方法未能捕捉到的失败模式。更多信息与资源可在项目网站获取:https://aka.ms/maira。

关键词

引用

@article{arxiv.2311.13668,
  title  = {MAIRA-1: A specialised large multimodal model for radiology report generation},
  author = {Stephanie L. Hyland and Shruthi Bannur and Kenza Bouzid and Daniel C. Castro and Mercy Ranjit and Anton Schwaighofer and Fernando Pérez-García and Valentina Salvatelli and Shaury Srivastav and Anja Thieme and Noel Codella and Matthew P. Lungren and Maria Teodora Wetscherek and Ozan Oktay and Javier Alvarez-Valle},
  journal= {arXiv preprint arXiv:2311.13668},
  year   = {2024}
}

备注

18 pages, 9 tables, 5 figures. v2 adds test IDs and image encoder citation. v3 fixes error in NPV/specificity