通过视觉检索增强生成来降低医学多模态大语言模型的幻觉
计算与语言
2025-02-24 v1 人工智能
摘要
多模态大语言模型(MLLMs)在视觉和文本任务中显示出惊人的性能。然而,幻觉仍是一个主要挑战,尤其是在信息关键的医疗领域。在本工作中,我们展示了如何通过视觉检索增强生成(V-RAG)来增强 MLLMs,该框架整合了来自检索图像的文本和视觉数据。在 MIMIC-CXR 胸部 X 光报告生成和 Multicare 医学图像描述生成数据集上,我们展示了视觉 RAG 改善了实体探测准确度,即询问医学实体是否由图像支撑。我们表明,改进不仅适用于常见实体,也适用于罕见实体,后者可能在正面训练数据中较少。下游,我们应用 V-RAG 结合实体探测来纠正幻觉并生成更临床准确的 X 光报告,获得更高的 RadGraph-F1 分数。
引用
@article{arxiv.2502.15040,
title = {Reducing Hallucinations of Medical Multimodal Large Language Models with Visual Retrieval-Augmented Generation},
author = {Yun-Wei Chu and Kai Zhang and Christopher Malon and Martin Renqiang Min},
journal= {arXiv preprint arXiv:2502.15040},
year = {2025}
}
备注
GenAI4Health - AAAI '25