中文

D-Rax:基于多模态数据和 eXpert 模型预测的领域特定放射学助手

人工智能 2024-08-05 v2 计算与语言 机器学习 图像与视频处理

摘要

大型视觉语言模型(VLMs)从研究向实际应用迈进,适用于通用场景。LLaVA-Med 是一个面向生物医学的大型语言和视觉助手,可以进行多模态生物医学图像和数据分析,为放射科医生提供自然语言界面。虽然它高度通用且能够处理多模态数据,但目前受制于大型语言模型领域已知的挑战。响应中的幻觉和不精确性可能导致误诊,从而阻碍了 VLMS 在临床中的适应性。为了在医疗保健领域创建精确、用户友好的模型,我们提出了 D-Rax——一个面向放射学的领域特定、对话式辅助工具,可用于获取特定放射学图像的洞察。本研究将 chest X-ray(CXR)图像的对话式分析得益于放射学报告,提供来自医学影像的全面见解,以辅助制定准确诊断。D-Rax 通过在我们精选的增强式指令数据上对 LLaVA-Med 架构进行微调实现,该数据包括图像、指令,以及来自 MIMIC-CXR 影像数据的疾病诊断和人口统计预测,CXR 相关的视觉问题答案(VQA)对,以及来自多个专家 AI 模型的预测结果。我们观察到在开放式和封闭式对话中,D-Rax 的响应相较于不利用线性结构的算法在样本效率方面具有巨大改进。

关键词

引用

@article{arxiv.2407.02604,
  title  = {D-Rax: Domain-specific Radiologic assistant leveraging multi-modal data and eXpert model predictions},
  author = {Hareem Nisar and Syed Muhammad Anwar and Zhifan Jiang and Abhijeet Parida and Ramon Sanchez-Jacob and Vishwesh Nath and Holger R. Roth and Marius George Linguraru},
  journal= {arXiv preprint arXiv:2407.02604},
  year   = {2024}
}

备注

accepted to the MICCAI 2024 Second International Workshop on Foundation Models for General Medical AI