中文

Bailicai:面向医疗应用的领域优化检索增强生成框架

计算与语言 2024-08-01 v1

摘要

大型语言模型(LLM)在自然语言理解方面表现突出,推动了其在各类领域的潜在应用广泛探索。在医疗领域,开源LLM在领域特定微调后表现有限,仍远不如GPT-4和GPT-3.5等专有模型。开源模型在领域知识覆盖面方面有限,生成文本时易出现“幻觉”。为缓解这些问题,研究者采用检索增强生成(RAG)方法,通过外部知识库中的背景信息增强LLM,同时保持模型内部参数不变。然而,文档噪声会影响性能,且医疗领域的RAG应用仍处于早期阶段。本文提出Bailicai框架:将检索增强生成与大型语言模型深度集成,专为医疗领域优化。Bailicai框架通过四个子模块显著提升LLM在医疗领域的性能。实验结果表明,Bailicai方法在多个医疗基准测试中超越现有医疗领域LLM,甚至优于GPT-3.5。此外,Bailicai有效缓解了医疗LLM应用中常见的幻觉问题,改善了传统RAG技术在处理无关或伪相关文档时的噪声相关挑战。

关键词

引用

@article{arxiv.2407.21055,
  title  = {Bailicai: A Domain-Optimized Retrieval-Augmented Generation Framework for Medical Applications},
  author = {Cui Long and Yongbin Liu and Chunping Ouyang and Ying Yu},
  journal= {arXiv preprint arXiv:2407.21055},
  year   = {2024}
}