中文

RULE:面向医学视觉语言模型事实性的可靠多模态检索增强生成

机器学习 2024-10-18 v2 人工智能 计算与语言 计算机视觉与模式识别 计算机与社会

摘要

最近出现的医学大型视觉语言模型(Med-LVLMs)已提升了医学诊断能力。然而,当前的 Med-LVLMs 常常遇到事实性问题,生成的响应不符合既定医学事实。检索增强生成(RAG)通过利用外部知识可改善这些模型的事实准确性,但引入两个主要挑战:首先,受限的检索上下文可能不覆盖所有必要信息,而过度检索则会引入无关且不准确的参考资料,干扰模型的生成;其次,在模型原本正确作答的情况下,应用 RAG 可能导致对检索上下文的过度依赖,导致错误答案。为此,我们提出了 RULE,包含两个组件:首先,我们引入一种通过对检索上下文数量进行校准来控制事实风险的可证明有效的方法;其次,我们基于导致对检索上下文过度依赖而出错的样本,构建了一个偏好数据集,用于微调模型,在内在知识与检索上下文之间实现生成的平衡。我们在医学 VQA 和报告生成任务上展示了 RULE 的有效性,实现了事实准确性平均提升 47.4%。我们公开了基准数据集和代码,地址为 https://github.com/richard-peng-xia/RULE。

关键词

引用

@article{arxiv.2407.05131,
  title  = {RULE: Reliable Multimodal RAG for Factuality in Medical Vision Language Models},
  author = {Peng Xia and Kangyu Zhu and Haoran Li and Hongtu Zhu and Yun Li and Gang Li and Linjun Zhang and Huaxiu Yao},
  journal= {arXiv preprint arXiv:2407.05131},
  year   = {2024}
}

备注

EMNLP 2024 main