中文

HeteroRAG:一种面向医学视觉语言任务的异构检索增强生成框架

计算与语言 2026-05-05 v2

摘要

医学大视觉语言模型(Med-LVLMs)在临床应用中展现出前景,但存在事实不准确和输出不可靠的问题,给实际诊断带来风险。虽然检索增强生成(RAG)已成为潜在解决方案,但当前的医学多模态 RAG 系统无法在异构来源之间进行有效检索。检索到的报告不相关性削弱了分析的事实性,而知识不足则影响临床决策的可信度。为弥合这一研究空白,我们构建了 MedAtlas,其中包含广泛的多模态报告库和多样化的文本语料库。基于此,我们提出了 HeteroRAG,一个通过异构知识源增强 Med-LVLMs 的新型框架。该框架引入了模态特异性 CLIP(Modality-specific CLIPs)用于有效报告检索,以及多语料库查询生成器(Multi-corpora Query Generator)用于适配多样化语料库。通过整合来自多方面的知识,进行了异构知识偏好调优(Heterogeneous Knowledge Preference Tuning),以实现跨模态和多源知识对齐。在 11 个数据集和 3 种模态上的广泛实验表明,HeteroRAG 在大多数医学视觉语言基准测试中取得了最先进性能,显著提升了 Med-LVLMs 的事实准确性和可靠性。

关键词

引用

@article{arxiv.2508.12778,
  title  = {HeteroRAG: A Heterogeneous Retrieval-Augmented Generation Framework for Medical Vision Language Tasks},
  author = {Zhe Chen and Yusheng Liao and Zhiyuan Zhu and Haolin Li and Hongcheng Liu and Yanfeng Wang and Yu Wang},
  journal= {arXiv preprint arXiv:2508.12778},
  year   = {2026}
}

备注

ACL 2026 Findings