中文

MedExpQA:面向医学问答的大语言模型多语言基准测试

计算与语言 2024-11-12 v2

摘要

大语言模型(LLM)具有促进人工智能技术发展的潜力,以协助医学专家进行交互式决策支持,这已通过其在医学问答中的优异表现得到证明。然而,尽管令人印象深刻,但医学应用所需的质量标准仍远未达到。目前,LLM 仍面临知识过时和倾向于生成幻觉内容的挑战。此外,大多数评估医学知识的基准缺乏参考黄金解释,这意味着无法评估 LLM 预测的推理过程。最后,如果我们考虑针对英语以外语言的 LLM 基准测试,情况尤为严峻,据我们所知,这仍是一个完全被忽视的课题。为了解决这些不足,本文提出了 MedExpQA,这是第一个基于医学考试的多语言基准,用于评估医学问答中的 LLM。据我们所知,MedExpQA 首次包含了由医学医生撰写的参考黄金解释,可利用这些解释建立各种基于黄金标准的上界,以与 LLM 的性能进行比较。使用黄金参考解释和检索增强生成(RAG)方法进行的全面多语言实验表明,LLM 的性能仍有很大的改进空间,特别是对于英语以外的语言。此外,尽管使用了最先进的 RAG 方法,我们的结果也证明了获取和整合现成医学知识的困难,而这些知识可能会对医学问答的下游评估结果产生积极影响。目前该基准有四种语言版本,但我们希望这项工作能鼓励进一步开发其他语言版本。

关键词

引用

@article{arxiv.2404.05590,
  title  = {MedExpQA: Multilingual Benchmarking of Large Language Models for Medical Question Answering},
  author = {Iñigo Alonso and Maite Oronoz and Rodrigo Agerri},
  journal= {arXiv preprint arXiv:2404.05590},
  year   = {2024}
}