优化医学问答系统:对比微调与零样本大语言模型在RAG框架下的表现
计算与语言
2025-12-08 v1 人工智能
摘要
医学问答(QA)系统可从大型语言模型(LLM)的突破中受益,但直接将LLM应用于临床领域会带来保持事实准确性和避免幻觉等挑战。本文提出一种基于检索增强生成(RAG)的医学QA系统,通过组合领域特定知识检索与开源LLM来回答医学问题。我们使用低秩适配(LoRA)对两种最先进的开源LLM(LLaMA~2和Falcon)进行微调,以实现高效的领域专业化。该系统检索相关医学文献以为LLM的答案提供依据,从而提高事实正确性并减少幻觉。我们在基准数据集(PubMedQA和MedMCQA)上进行评估,结果表明检索增强相较于仅使用LLM可实现可衡量的答案准确率提升。我们的微调LLaMA~2模型在PubMedQA上达到71.8%的准确率,显著优于55.4%的零样本基线,同时通过提供来源参考维持了透明度。我们还详细阐述了系统设计和微调方法,证明基于检索证据的答案可将不支持内容减少约60%。这些结果凸显了RAG增强型开源LLM在可靠生物医学QA方面的潜力,指向实际的临床信息学应用。
引用
@article{arxiv.2512.05863,
title = {Optimizing Medical Question-Answering Systems: A Comparative Study of Fine-Tuned and Zero-Shot Large Language Models with RAG Framework},
author = {Tasnimul Hassan and Md Faisal Karim and Haziq Jeelani and Elham Behnam and Robert Green and Fayeq Jeelani Syed},
journal= {arXiv preprint arXiv:2512.05863},
year = {2025}
}