MedXChat:面向胸部X光图像理解与生成的统一多模态大语言模型框架
计算机视觉与模式识别
2024-05-13 v2
摘要
多模态大语言模型(MLLMs)已在各种通用图像处理任务中展现出成功,但其在医学影像中的应用尚处于起步阶段,缺乏专门的模型。本研究探讨了 MLLMs 在改进胸部X光图像(CXRs)理解与生成方面的潜力。我们引入了 MedXChat,这是一个统一框架,促进了医疗助手与用户之间在多种 CXR 任务中的无缝交互,包括文本报告生成、视觉问答(VQA)以及文本到 CXR 生成。我们使用自然语言作为输入的 MLLMs 打破了任务边界,通过允许在单一环境中执行多种任务,最大限度地简化了医疗专业训练。对于 CXR 理解,我们利用现成的强大视觉编码器(如 ViT)和 LLMs(如 mPLUG-Owl)将医学图像转换为类语言特征,随后使用视觉适配器网络和 delta-tuning 方法对大型预训练模型进行医学应用微调。对于 CXR 生成,我们引入了一种创新的合成方法,利用了 Stable Diffusion (SD) 架构内的指令遵循能力。该技术与现有模型框架平滑集成,无需额外参数,从而在保持 SD 生成能力的同时,赋予其高保真渲染细粒度医学图像的能力。通过全面的实验,我们的模型展现出卓越的跨任务适应性,在所有三个定义的任务中均表现出色。我们的 MedXChat 模型和本研究中使用的指令数据集将公开发布,以鼓励该领域的进一步探索。
引用
@article{arxiv.2312.02233,
title = {MedXChat: A Unified Multimodal Large Language Model Framework towards CXRs Understanding and Generation},
author = {Ling Yang and Zhanyu Wang and Zhenghao Chen and Xinyu Liang and Luping Zhou},
journal= {arXiv preprint arXiv:2312.02233},
year = {2024}
}