中文

通过视觉检索增强生成来降低医学多模态大语言模型的幻觉

计算与语言 2025-02-24 v1 人工智能

摘要

多模态大语言模型(MLLMs)在视觉和文本任务中显示出惊人的性能。然而,幻觉仍是一个主要挑战,尤其是在信息关键的医疗领域。在本工作中,我们展示了如何通过视觉检索增强生成(V-RAG)来增强 MLLMs,该框架整合了来自检索图像的文本和视觉数据。在 MIMIC-CXR 胸部 X 光报告生成和 Multicare 医学图像描述生成数据集上,我们展示了视觉 RAG 改善了实体探测准确度,即询问医学实体是否由图像支撑。我们表明,改进不仅适用于常见实体,也适用于罕见实体,后者可能在正面训练数据中较少。下游,我们应用 V-RAG 结合实体探测来纠正幻觉并生成更临床准确的 X 光报告,获得更高的 RadGraph-F1 分数。

关键词

引用

@article{arxiv.2502.15040,
  title  = {Reducing Hallucinations of Medical Multimodal Large Language Models with Visual Retrieval-Augmented Generation},
  author = {Yun-Wei Chu and Kai Zhang and Christopher Malon and Martin Renqiang Min},
  journal= {arXiv preprint arXiv:2502.15040},
  year   = {2025}
}

备注

GenAI4Health - AAAI '25