MedEval:用于语言模型评估的多层级、多任务、多领域医学基准
计算与语言
2023-11-16 v3
摘要
由于需要专家人工标注,用于医疗的策展数据集往往受限。本文提出 MedEval,一个多层级、多任务、多领域的医学基准,以促进医疗语言模型的发展。MedEval 全面且包含来自多个医疗系统的数据,涵盖 8 种检查模态下的 35 个人体区域。我们收集了 22,779 个句子和 21,228 份报告,提供了多层级专家标注,赋予数据细粒度的潜在用途并支持广泛任务。此外,我们在零样本和微调设定下系统评估了 10 个通用与领域专用语言模型,从医疗领域适配基线到通用最先进大语言模型(如 ChatGPT)。我们的评估揭示了两类语言模型在不同任务上的效果差异,并注意到指令微调对大语言模型少样本使用的重要性。我们的研究为医疗语言模型基准测试铺平道路,并提供了关于在医学领域采用大语言模型优势与局限的宝贵见解,为其实际使用和未来进展提供参考。
引用
@article{arxiv.2310.14088,
title = {MedEval: A Multi-Level, Multi-Task, and Multi-Domain Medical Benchmark for Language Model Evaluation},
author = {Zexue He and Yu Wang and An Yan and Yao Liu and Eric Y. Chang and Amilcare Gentili and Julian McAuley and Chun-Nan Hsu},
journal= {arXiv preprint arXiv:2310.14088},
year = {2023}
}
备注
Accepted to EMNLP 2023. Camera-ready version: updated IRB, added more evaluation results on LLMs such as GPT4, LLaMa2, and LLaMa2-chat