中文

大语言模型在数值与语义医学知识上的表现:基于循证问答的基准测试

计算与语言 2024-07-25 v3

摘要

临床问题解决需要处理语义医学知识(如疾病脚本)和诊断测试的数值医学知识,以进行循证决策。尽管大语言模型在语言临床实践的许多方面显示出有希望的结果,但它们生成基于非语言证据的临床问题答案的能力本质上受到分词的制约。因此,我们评估了LLM在两种问题类型上的表现:数值型(关联发现)和语义型(区分实体),同时检查了LLM内部和之间在医学方面的差异,并将其性能与人类进行比较。为了生成基于循证医学的简单多项选择问题和答案,我们使用了一个全面的医学知识图谱(包含来自50,000多篇同行评审文章的数据),并创建了“EBMQA”。EBMQA包含105,000个问答对,标注了医学和非医学主题,并分类为数值或语义问题。我们使用超过24,500个问答对在两个最先进的LLM:Chat-GPT4和Claude3-Opus上对该数据集进行了基准测试。我们评估了LLM在语义和数值问题类型上的准确性,并根据子标签主题进行了评估。为了验证,六名医学专家接受了100个数值EBMQA问题的测试。我们发现,两个LLM在语义问答上的表现均优于数值问答,Claude3在数值问答上超过了GPT4。然而,两个LLM在不同医学方面均表现出内部和外部差距,并且仍然不如人类。因此,应谨慎对待它们的医学建议。

关键词

引用

@article{arxiv.2406.03855,
  title  = {Performance of large language models in numerical vs. semantic medical knowledge: Benchmarking on evidence-based Q&As},
  author = {Eden Avnat and Michal Levy and Daniel Herstain and Elia Yanko and Daniel Ben Joya and Michal Tzuchman Katz and Dafna Eshel and Sahar Laros and Yael Dagan and Shahar Barami and Joseph Mermelstein and Shahar Ovadia and Noam Shomron and Varda Shalev and Raja-Elie E. Abdulnour},
  journal= {arXiv preprint arXiv:2406.03855},
  year   = {2024}
}