面向 LLM 的多模态检索:用于 RAG 医学诊断的通用模型
计算机视觉与模式识别
2026-04-21 v6
摘要
从医学文献和医院记录中检索视觉和文本信息可以增强临床图像解读的诊断准确性。然而,多模态检索增强诊断面临着巨大挑战。我们探索了一种轻量级机制,用于增强检索增强型大语言模型(LVLM)的诊断性能。我们训练了一个轻量级 LVLM-aware 多模态检索器,使得检索器学习返回引导 LVLM 向正确预测靠近的图像和文本。在低资源环境下,我们仅进行少量数据的轻量级微调,并仅使用通用模型,实现了在临床分类和 VQA 任务上的竞争性能,与在大量训练数据上预训练的医学模型相当。在一种新颖的分析中,我们指出了一种之前未被发现的错误类别,称为不一致检索预测:即不同顶部检索图像对同一目标产生不同预测的情况。我们发现,这些情况对所有模型都具有挑战性,甚至包括非检索模型,并且我们的检索优化机制在标准 RAG 之上显著改进了这些情况。然而,我们的分析也揭示了 LVLMs 在利用检索信息进行临床预测方面的能力之间的差距。代码和模型可在 https://github.com/Nirmaz/CLARE 获取。
引用
@article{arxiv.2508.17394,
title = {LVLM-Aware Multimodal Retrieval for RAG-Based Medical Diagnosis with General-Purpose Models},
author = {Nir Mazor and Tom Hope},
journal= {arXiv preprint arXiv:2508.17394},
year = {2026}
}