中文

MEDITRON-70B:面向大语言模型的医学预训练扩展

计算与语言 2023-11-28 v1 人工智能 机器学习

摘要

大语言模型(LLMs)有潜力使医学知识的获取民主化。尽管已有诸多努力来利用和提升 LLM 的医学知识与推理能力,但由此得到的模型要么闭源(如 PaLM、GPT-4),要么规模受限(参数 ≤ 13B),这制约了它们的能力。在本工作中,我们通过发布 MEDITRON 提升对大规模医学 LLM 的获取:一套参数为 7B 和 70B、适配医学领域的开源 LLM。MEDITRON 构建于 Llama-2 之上(通过我们对 Nvidia Megatron-LM 分布式训练器的适配),并在精心筛选的医学语料上扩展预训练,该语料包括精选的 PubMed 文章、摘要以及国际公认的医学指南。使用四个主要医学基准的评估显示,在任务特定微调前后均相较多个最先进基线取得显著性能提升。总体而言,MEDITRON 在其参数类别中比最佳公开基线实现 6% 的绝对性能提升,比我们从 Llama-2 微调出的最强基线高 3%。与闭源 LLM 相比,MEDITRON-70B 优于 GPT-3.5 和 Med-PaLM,且与 GPT-4 差距在 5% 以内、与 Med-PaLM-2 差距在 10% 以内。我们发布了用于构建医学预训练语料的代码以及 MEDITRON 模型权重,以推动更强大医学 LLM 的开源发展。

关键词

引用

@article{arxiv.2311.16079,
  title  = {MEDITRON-70B: Scaling Medical Pretraining for Large Language Models},
  author = {Zeming Chen and Alejandro Hernández Cano and Angelika Romanou and Antoine Bonnet and Kyle Matoba and Francesco Salvi and Matteo Pagliardini and Simin Fan and Andreas Köpf and Amirkeivan Mohtashami and Alexandre Sallinen and Alireza Sakhaeirad and Vinitra Swamy and Igor Krawczuk and Deniz Bayazit and Axel Marmet and Syrielle Montariol and Mary-Anne Hartley and Martin Jaggi and Antoine Bosselut},
  journal= {arXiv preprint arXiv:2311.16079},
  year   = {2023}
}