MedExQA:具有多重解释的医学问答基准
计算与语言
2024-07-04 v2 人工智能
摘要
本文介绍了 MedExQA,一个医学问答领域的新颖基准,旨在通过解释评估大型语言模型 对医学知识的理解。通过在当前数据集中代表性不足的五个不同医学专业构建数据集,并进一步为每个问答对引入多重解释,我们填补了当前医学问答基准中的一个主要空白,即缺乏对 LLM 生成细致医学解释能力的全面评估。我们的工作强调了医学 LLM 可解释性的重要性,提出了一种超越分类准确性的有效模型评估方法,并揭示了一个特定领域——言语语言病理学,在该领域中包括 GPT4 在内的当前 LLM 缺乏良好的理解。我们的结果表明,基于多重解释的生成评估与人类评估更为一致,突显了为 LLM 提供更稳健的自动化理解评估的机遇。为了丰富开源医学 LLM(目前大多基于 Llama2),本工作还提出了一种基于 Phi-2 (2.7B) 的新型医学模型 MedPhi-2。该模型在生成解释方面优于基于 Llama2-70B 的医学 LLM,展现了其在资源受限的医学领域的有效性。我们将分享我们的基准数据集和训练好的模型。
引用
@article{arxiv.2406.06331,
title = {MedExQA: Medical Question Answering Benchmark with Multiple Explanations},
author = {Yunsoo Kim and Jinge Wu and Yusuf Abdulle and Honghan Wu},
journal= {arXiv preprint arXiv:2406.06331},
year = {2024}
}
备注
Accepted to ACL2024 BioNLP Workshop