MAIRA-Seg:利用分割感知多模态大语言模型增强放射学报告生成
计算机视觉与模式识别
2024-11-19 v1 计算与语言
摘要
将人工智能应用于放射学报告生成,尤其是胸部 X 光片(CXRs),正受到越来越多的关注。本文研究了通过分割掩码引入像素级信息,是否能够改善多模态大语言模型(MLLMs)在放射学报告生成中的细粒度图像理解能力。我们引入了 MAIRA-Seg,这是一个分割感知的 MLLM 框架,旨在利用语义分割掩码和 CXRs 来生成放射学报告。我们训练了专家分割模型,以获取 CXRs 中放射学特定结构的掩码伪标签。随后,在 MAIRA(一个用于报告生成的 CXR 专用模型)的架构基础上,我们集成了一个利用这些掩码伪标签的可训练分割 token 提取器,并采用掩码感知提示来生成放射学报告草稿。我们在公开的 MIMIC-CXR 数据集上的实验表明,MAIRA-Seg 优于非分割基线。我们还研究了 MAIRA 的 set-of-marks 提示,发现 MAIRA-Seg 始终表现出相当或更优的性能。结果证实,使用分割掩码增强了 MLLMs 的细致推理能力,可能有助于带来更好的临床结果。
引用
@article{arxiv.2411.11362,
title = {MAIRA-Seg: Enhancing Radiology Report Generation with Segmentation-Aware Multimodal Large Language Models},
author = {Harshita Sharma and Valentina Salvatelli and Shaury Srivastav and Kenza Bouzid and Shruthi Bannur and Daniel C. Castro and Maximilian Ilse and Sam Bond-Taylor and Mercy Prasanna Ranjit and Fabian Falck and Fernando Pérez-García and Anton Schwaighofer and Hannah Richardson and Maria Teodora Wetscherek and Stephanie L. Hyland and Javier Alvarez-Valle},
journal= {arXiv preprint arXiv:2411.11362},
year = {2024}
}
备注
Accepted as Proceedings Paper at ML4H 2024