检索增强医学问答的检索流水线设计系统研究
计算与语言
2026-04-09 v1 人工智能
机器学习
摘要
大语言模型(LLM)在医学问答中展现出强大能力;然而,纯参数模型常面临知识空白和有限的事实基础。检索增强生成(RAG)通过将外部知识检索集成到推理过程中来解决这一限制。尽管对基于RAG的医学系统兴趣日益增长,但各检索组件对性能的影响仍理解不足。本研究对检索增强医学问答进行了系统评估,使用MedQA USMLE基准和结构化教科书知识语料库。我们分析了语言模型、嵌入模型、检索策略、查询改写和交叉编码器重排序之间的交互,在一个包含四十种配置的一致实验框架中进行。结果表明检索增强显著改善了零样本医学问答性能。表现最佳的配置为稠密检索结合查询改写和重排序,准确率达到60.49%。领域专用语言模型也被发现比通用模型更好地利用检索到的医学证据。分析进一步揭示了检索有效性与计算成本之间的明确权衡,简单的稠密检索配置在保持较高吞吐量的同时提供了强劲性能。所有实验均在单张消费级GPU上进行,证明了可在适度计算资源下对检索增强医学问答系统进行系统评估。
引用
@article{arxiv.2604.07274,
title = {A Systematic Study of Retrieval Pipeline Design for Retrieval-Augmented Medical Question Answering},
author = {Nusrat Sultana and Abdullah Muhammad Moosa and Kazi Afzalur Rahman and Sajal Chandra Banik},
journal= {arXiv preprint arXiv:2604.07274},
year = {2026}
}