中文

通用基础模型能否超越专用微调?以医学为例的研究

计算与语言 2023-11-29 v1

摘要

GPT-4 等通用基础模型在广泛领域和任务中展现出令人惊讶的能力。然而,一种普遍假设认为它们无法匹敌微调模型的专家级能力。例如,迄今为止大多数关于医学能力基准的探索都利用了领域特定训练,如 BioGPT 和 Med-PaLM 上的工作所示。我们基于先前一项关于 GPT-4 在无特殊训练情况下医学挑战基准能力的研究。我们并非使用简单提示来凸显模型的即用能力,而是对提示工程进行了系统性探索。我们发现提示创新能够释放更深层的专家能力,并展示 GPT-4 轻松超越先前医学基准的领先结果。我们探索的提示方法是通用目的的,并未具体利用领域专业知识,从而免除了对专家策划内容的需求。我们的实验设计在提示工程过程中仔细控制了过拟合。我们引入了 Medprompt,基于多种提示策略的组合。借助 Medprompt,GPT-4 在 MultiMedQA 套件的所有九个基准数据集上均达到最先进结果。该方法以少一个数量级的模型调用次数大幅优于 Med-PaLM 2 等领先专用模型。使用 Medprompt 引导 GPT-4 在 MedQA 数据集上比迄今专用模型达到的最佳方法错误率降低 27%,并首次超越 90% 的分数。除医学问题外,我们展示了 Medprompt 推广到其他领域的威力,并通过在电气工程、机器学习、哲学、会计、法律、护理和临床心理学考试上对该策略的研究提供了该方法广泛适用性的证据。

关键词

引用

@article{arxiv.2311.16452,
  title  = {Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine},
  author = {Harsha Nori and Yin Tat Lee and Sheng Zhang and Dean Carignan and Richard Edgar and Nicolo Fusi and Nicholas King and Jonathan Larson and Yuanzhi Li and Weishung Liu and Renqian Luo and Scott Mayer McKinney and Robert Osazuwa Ness and Hoifung Poon and Tao Qin and Naoto Usuyama and Chris White and Eric Horvitz},
  journal= {arXiv preprint arXiv:2311.16452},
  year   = {2023}
}

备注

21 pages, 7 figures