中文

小模型或大模型?零样本还是微调?为医疗领域特定应用指导语言模型选择

计算与语言 2025-09-25 v2 人工智能 机器学习

摘要

本研究旨在指导语言模型选择,通过探讨:1)微调是否必要以区别于零样本使用,2)域相邻模型相较于通用预训练模型的收益,3)进一步的域特定预训练价值,以及4)在特定任务中,小型语言模型(SLM)相较于大型语言模型(LLM)的持续相关性。我们使用来自英国哥伦比亚癌症注册局(BCCR)的电子病理报告,评估三个难度和数据规模不同的分类场景。模型包括各种SLM和一个LLM。SLM分别在零样本和微调后进行评估;LLM仅在零样本下评估。微调显著提升了SLM在所有场景中的性能,相较于其零样本结果。零样本LLM在零样本下超过零样本SLM,但始终被微调后的SLM所超越。域相邻SLM在微调后通常优于通用SLM,尤其在难以处理的任务上。进一步的域特定预训练在较简单的任务上带来有限的收益,但在复杂、数据稀缺的任务上显著性地提高了性能。结果凸显了在专业领域中,针对SLM进行微调的关键作用,使其在针对性分类任务上超越零样本LLM。域相邻或域特定数据的预训练提供了进一步的优势,特别是对于复杂问题或有限微调数据的情形。尽管LLM提供了强大的零样本能力,但在这些特定任务上的性能未达到经过恰当微调的SLM的性能。在LLM时代,SLM仍然相关且有效,提供了潜在上更优的性能-资源权衡。

关键词

引用

@article{arxiv.2504.21191,
  title  = {Small or Large? Zero-Shot or Finetuned? Guiding Language Model Choice for Specialized Applications in Healthcare},
  author = {Lovedeep Gondara and Jonathan Simkin and Graham Sayle and Shebnum Devji and Gregory Arbour and Raymond Ng},
  journal= {arXiv preprint arXiv:2504.21191},
  year   = {2025}
}