中文

小语言模型从医学教科书中学习增强的推理技能

计算与语言 2024-07-02 v2

摘要

尽管近期商业大语言模型(LM)在医学任务中展现出可喜的成果,但其闭源特性引发了重大的隐私与安全担忧,阻碍了其在医学领域的广泛应用。尽管已有诸多努力构建开源模型,但其有限的参数量往往导致其缺乏解决复杂医学问题所需的多步推理能力。为解决此问题,我们引入了 Meerkat,一个参数量从 70 亿到 700 亿不等的新型医学 AI 系统家族。该模型使用我们新构建的合成数据集进行训练,该数据集包含源自 18 本医学教科书的高质量思维链推理路径,以及多样化的指令遵循数据集。我们的系统在六个医学基准测试中取得了出色的准确率,大幅超越了此前最优模型(如 MediTron 和 BioMistral)以及 GPT-3.5。值得注意的是,Meerkat-7B 首次作为 7B 参数模型超越了美国执业医师资格考试(USMLE)的及格线,而 Meerkat-70B 则平均优于 GPT-4 1.3%。此外,Meerkat-70B 在 38 个复杂临床病例中正确诊断了 21 例,优于人类的 13.8 例,并与 GPT-4 的 21.8 例十分接近。与现有小模型相比,我们的系统对临床查询提供了更详细的自由文本回复,接近大型商业模型的性能水平。这显著缩小了与大型 LM 的性能差距,展示了其在应对复杂医学挑战中的有效性。

关键词

引用

@article{arxiv.2404.00376,
  title  = {Small Language Models Learn Enhanced Reasoning Skills from Medical Textbooks},
  author = {Hyunjae Kim and Hyeon Hwang and Jiwoo Lee and Sihyeon Park and Dain Kim and Taewhoo Lee and Chanwoong Yoon and Jiwoong Sohn and Donghee Choi and Jaewoo Kang},
  journal= {arXiv preprint arXiv:2404.00376},
  year   = {2024}
}

备注

Added new LLaMA-3-based models and experiments on NEJM case challenges