面向医疗领域的通用大语言模型评估与构建
计算与语言
2024-09-06 v2
摘要
本研究提出了 MedS-Bench,一个综合性基准,用于评估大语言模型 (LLM) 在临床情境中的性能。与现有聚焦于多选题答题的基准不同,MedS-Bench 涵盖 11 项高层次临床任务,包括临床报告摘要、治疗建议、诊断、命名实体识别和医学概念解释等。我们评估了六个领先的 LLM(如 MEDITRON、Mistral、InternLM 2、Llama 3、GPT-4 和 Claude-3.5),使用 few-shot 提示方法,发现即便是最先进的模型在这些复杂任务中也表现不佳。为此,我们开发了 MedS-Ins,一个大规模医学指令调优数据集。MedS-Ins 包含 58 个医学语言语料,总计 1350 万样本,覆盖 122 项任务。为证明数据集的有效性,我们对轻量级开源医学语言模型进行指令调优。结果得到的模型 MMedIns-Llama 3 在 nearly all 临床任务中均显著优于现有模型。为推动 LLM 在临床挑战中的应用,我们已完全公开 MedS-Ins 数据集,并邀请研究社区扩展其规模。此外,我们已推出 MedS-Bench 的动态排行榜,将定期更新测试集以跟踪进展并增强通用 LLM 适应医学领域的能力。排行榜:https://henrychur.github.io/MedS-Bench/。GitHub:https://github.com/MAGIC-AI4Med/MedS-Ins。
关键词
引用
@article{arxiv.2408.12547,
title = {Towards Evaluating and Building Versatile Large Language Models for Medicine},
author = {Chaoyi Wu and Pengcheng Qiu and Jinxin Liu and Hongfei Gu and Na Li and Ya Zhang and Yanfeng Wang and Weidi Xie},
journal= {arXiv preprint arXiv:2408.12547},
year = {2024}
}