中文

DrugRAG:通过新型检索增强生成流水线提升药学大语言模型性能

机器学习 2025-12-18 v1 人工智能

摘要

在我们的研究中,我们评估了大语言模型(LLM)在药学执照风格问答任务上的表现,并开发了一种外部知识集成方法以提高准确性。我们使用一个包含 141 个问题的药学数据集,对十个参数规模不同(80 亿到 700 亿以上)的大语言模型进行了基准测试,测量未经修改的基线准确率。基线性能范围为 46% 到 92%,其中 GPT-5(92%)和 o3(89%)得分最高,而较小的开源模型表现明显较低。随后我们开发了 DrugRAG,一个三步检索增强生成(RAG)流水线,它检索结构化、基于证据的药物信息,并通过上下文药理学证据增强模型提示,在外部运行且无需更改模型架构或参数。DrugRAG 提升了所有五个评估模型的准确率,增益范围为 7 到 21 个百分点(例如,Gemma 3 27B:从 61.0% 提升至 71%,Llama 3.1 8B:从 46% 提升至 67%)。McNemar 分析证明了在较小和中等规模开源模型上统计显著的配对提升。这些发现表明,通过 DrugRAG 集成结构化外部药物知识可以在不修改底层模型的情况下提升语言模型在药学专注问答任务上的性能,为增强基于证据的药学专注人工智能应用提供了一个实用流水线。

关键词

引用

@article{arxiv.2512.14895,
  title  = {Imitation Learning for Multi-turn LM Agents via On-policy Expert Corrections},
  author = {Niklas Lauffer and Xiang Deng and Srivatsa Kundurthy and Brad Kenstler and Jeff Da},
  journal= {arXiv preprint arXiv:2512.14895},
  year   = {2025}
}