中文

MedREQAL:通过问答测试大型语言模型的医学知识记忆

计算与语言 2024-06-11 v1

摘要

近年来,大型语言模型(LLM)在大规模文本语料的预训练中展现了惊人的知识编码能力。它们可以利用这一知识为下游任务,如问答(QA),提供支持,包括涉及健康主题的复杂问题。鉴于其在未来促进临床工作的巨大潜力,理解大型语言模型中编码医学知识质量及其记忆能力是下一步重要的步骤。在本研究中,我们通过构建一个新的数据集来检验大型语言模型展现医学知识记忆的能力,该数据集源于系统综述——即为特定医学问题提供证据基础答案的研究。通过在新构建的MedREQAL数据集上进行实验,该数据集包含来自严格系统综述中提取的问答对,我们评估了六种大型语言模型,如GPT和Mixtral,分析了其分类和生成性能。我们的实验洞察揭示了大型语言模型在这一新型生物医学QA数据集上的表现仍具有挑战性。

关键词

引用

@article{arxiv.2406.05845,
  title  = {MedREQAL: Examining Medical Knowledge Recall of Large Language Models via Question Answering},
  author = {Juraj Vladika and Phillip Schneider and Florian Matthes},
  journal= {arXiv preprint arXiv:2406.05845},
  year   = {2024}
}

备注

Accepted to ACL 2024 (Findings)