中文

MIRA:医学 RAG 中融合模态的新框架

计算机视觉与模式识别 2025-07-11 v1

摘要

多模态大语言模型 (MLLMs) 显著推进了 AI 辅助医疗诊断,但它们经常生成偏离既定医学知识的事实不一致响应。检索增强生成 (RAG) 通过整合外部来源增强了事实准确性,但它带来了两个关键挑战。首先,不充分的检索可能会遗漏关键信息,而过度的检索可能会引入不相关或误导性的内容,从而扰乱模型输出。其次,即使模型最初提供了正确答案,过度依赖检索数据也可能导致事实错误。为了解决这些问题,我们引入了多模态智能检索与增强 (MIRA) 框架,旨在优化 MLLM 中的事实准确性。MIRA 包含两个关键组件:(1) 一个校准的反思与重排模块,动态调整检索上下文的数量以管理事实风险,以及 (2) 一个医学 RAG 框架,集成了图像嵌入和医学知识库,并带有用于高效多模态推理的查询重写模块。这使模型能够有效整合其固有知识与外部参考。我们在公开可用的医学 VQA 和报告生成基准上的评估表明,MIRA 显著增强了事实准确性和整体性能,取得了新的 SOTA 结果。代码发布于 https://github.com/mbzuai-oryx/MIRA。

关键词

引用

@article{arxiv.2507.07902,
  title  = {MIRA: A Novel Framework for Fusing Modalities in Medical RAG},
  author = {Jinhong Wang and Tajamul Ashraf and Zongyan Han and Jorma Laaksonen and Rao Mohammad Anwer},
  journal= {arXiv preprint arXiv:2507.07902},
  year   = {2025}
}

备注

ACM Multimedia 2025