中文

OpenMedLM:基于开源大语言模型的医学问答中,提示工程可优于微调

计算与语言 2024-03-01 v1 人工智能 信息检索

摘要

大语言模型正在变得越来越高效,能够完成各种专业任务,可用于扩大对医学知识的平等获取。目前大多数医学 LLM 都涉及大量微调,利用专业医学数据和大量昂贵的计算资源。许多顶尖 LLM 属于专有模型,其访问权限仅限于极少数研究小组。然而,开源模型因性能显著提升以及在医疗保健领域所需的透明性和合规性而成为医学 LLM 的关键增长领域。我们提出 OpenMedLM,一个提示平台,为开源 LLM 在医学基准测试上提供最新 (SOTA) 性能。我们评估了多种开源基础 LLM(7B-70B)在四个医学基准测试(MedQA、MedMCQA、PubMedQA、MMLU 医学子集)上的表现。我们采用了包括零-shot、few-shot、链式思维(随机选择和 kNN 选择)以及集合/自洽投票等一系列提示策略。我们发现 OpenMedLM 在三个常见医学 LLM 基准测试中实现了开源 SOTA 成绩,超越了之前使用计算昂贵的大量微调的模型。该模型在 MedQA 基准测试中实现 72.6% 的准确率,超越前一 SOTA 2.4%,并在 MMLU 医学子集上实现 81.7% 的准确率,首次实现开源 LLM 在该基准测试中超越 80% 的准确率。我们的结果揭示了开源 LLM 在迄今为止尚未在其他地方记录的医学特定涌现特性,并展示了进一步利用提示工程来提高可访问 LLM 在医疗应用中的性能方面的优势。

关键词

引用

@article{arxiv.2402.19371,
  title  = {OpenMedLM: Prompt engineering can out-perform fine-tuning in medical question-answering with open-source large language models},
  author = {Jenish Maharjan and Anurag Garikipati and Navan Preet Singh and Leo Cyrus and Mayank Sharma and Madalina Ciobanu and Gina Barnes and Rahul Thapa and Qingqing Mao and Ritankar Das},
  journal= {arXiv preprint arXiv:2402.19371},
  year   = {2024}
}