中文

模型微调还是提示微调?大语言模型用于临床概念与关系抽取的实证研究

计算与语言 2024-04-16 v1 人工智能

摘要

目的:开发基于软提示的大语言模型(LLM)学习算法,考察提示的形态、使用冻结/非冻结 LLM 的提示微调、迁移学习及少样本学习能力。方法:我们开发了基于软提示的 LLM 模型,并比较了四种训练策略,包括(1)无提示的微调;(2)非冻结 LLM 的硬提示;(3)非冻结 LLM 的软提示;(4)冻结 LLM 的软提示。我们在两个基准数据集上,使用这四种训练策略评估了 7 个预训练 LLM 用于临床概念与关系抽取的效果。我们评估了基于提示的学习算法在跨机构环境下的迁移学习能力,并考察了其少样本学习能力。结果与结论:当 LLM 非冻结时,采用软提示的 GatorTron-3.9B 在概念抽取上取得最优严格 F1 分数 0.9118 和 0.8604,分别优于传统微调与硬提示模型 0.6~3.1% 和 1.2~2.9%;采用软提示的 GatorTron-345M 在端到端关系抽取上取得最优 F1 分数 0.8332 和 0.7488,分别优于另外两种模型 0.2~2% 和 0.6~11.7%。当 LLM 冻结时,小规模(即 3.45 亿参数)LLM 与未冻结模型相比竞争力差距较大;将 LLM 扩展至数十亿参数可使冻结 LLM 与未冻结 LLM 相当。在跨机构评估中,采用冻结 GatorTron-8.9B 模型的软提示取得了最佳性能。本研究表明:(1)机器学习软提示优于人类;(2)冻结 LLM 具有更好的少样本学习能力与迁移学习能力,有助于多机构应用;(3)冻结 LLM 需要大型模型。

关键词

引用

@article{arxiv.2310.06239,
  title  = {Model Tuning or Prompt Tuning? A Study of Large Language Models for Clinical Concept and Relation Extraction},
  author = {Cheng Peng and Xi Yang and Kaleb E Smith and Zehao Yu and Aokun Chen and Jiang Bian and Yonghui Wu},
  journal= {arXiv preprint arXiv:2310.06239},
  year   = {2024}
}