面向医学多模态大语言模型的主动推理-检索框架
计算机视觉与模式识别
2025-10-22 v1
摘要
激发多模态大语言模型(MLLMs)的推理能力对于医学应用至关重要,以便透明地分析医学扫描并提供可靠诊断。然而,现有医学 MLLMs 仅依赖内部知识进行推理,导致在遇到训练范围之外的案例时出现幻觉式推理和事实性错误。尽管近期的基于代理的检索增强生成(RAG)方法在推理过程中激发医学模型的主动检索能力,但它们局限于单模态 LLM,忽略了推理和检索中至关重要的视觉信息。因此,我们提出首个医学多模态推理-检索框架——Med-RwR,通过在推理过程中主动查询观察到的症状或领域特定医学概念来检索外部知识。具体而言,我们设计了两个阶段的强化学习策略,配以量身定制的奖励,以激励模型在有效检索中利用视觉诊断发现和文本临床信息。基于此,我们进一步提出了置信度驱动的图像重新检索(CDIR)方法,用于在检测到低预测置信度时的测试时间扩展。在 various public medical benchmarks 上的评估表明,Med-RwR 在基线模型之上实现了显著的性能提升,证明了通过外部知识集成来增强推理能力的有效性。此外,Med-RwR 在面对不熟悉领域时展现出惊人的通用性,尽管心脏超声数据在训练语料中稀缺,但在我们提出的 EchoCardiography Benchmark(ECBench)上实现了 8.8% 的性能提升。我们的数据、模型和代码将在 https://github.com/xmed-lab/Med-RwR 上公开。
引用
@article{arxiv.2510.18303,
title = {Proactive Reasoning-with-Retrieval Framework for Medical Multimodal Large Language Models},
author = {Lehan Wang and Yi Qin and Honglong Yang and Xiaomeng Li},
journal= {arXiv preprint arXiv:2510.18303},
year = {2025}
}
备注
Work in progress