中文

BioInstruct:面向生物医学自然语言处理的大语言模型指令微调

计算与语言 2024-06-10 v3 人工智能

摘要

通过引入领域特定指令数据集并考察其与多任务学习原则结合的影响,提升大语言模型(LLMs)在生物医学自然语言处理(BioNLP)中的性能。我们创建了 BioInstruct,包含 25,005 条指令用于对 LLMs(LLaMA 1 与 2,7B 与 13B 版本)进行指令微调。指令通过对 GPT-4 语言模型输入从 80 条人工整理指令中随机抽取的三样本种子提示而生成。我们采用低秩自适应(LoRA)进行参数高效微调。随后我们在若干 BioNLP 任务上评估这些指令微调后的 LLMs,这些任务可分为三大类:问答(QA)、信息抽取(IE)与文本生成(GEN)。我们还考察了指令类别(如 QA、IE 与生成)是否影响模型性能。与未指令微调的 LLMs 相比,我们的指令微调 LLMs 表现出显著性能提升:QA 提升 17.3%、IE 提升 5.7%、生成任务提升 96%。我们 7B 参数的指令微调 LLaMA 1 模型在生物医学领域具有竞争力,甚至超越其他同样基于 LLaMA 1 并用大量领域数据或多种任务微调的 LLMs。我们的结果还显示,当指令微调在紧密相关的任务上进行时性能增益显著更高。我们的发现与多任务学习的观察一致,提示了两任务间的协同效应。BioInstruct 数据集是一项宝贵资源,指令微调后的 LLMs 带来了性能最优的 BioNLP 应用。

关键词

引用

@article{arxiv.2310.19975,
  title  = {BioInstruct: Instruction Tuning of Large Language Models for Biomedical Natural Language Processing},
  author = {Hieu Tran and Zhichao Yang and Zonghai Yao and Hong Yu},
  journal= {arXiv preprint arXiv:2310.19975},
  year   = {2024}
}

备注

This article has been accepted for publication in Journal of the American Medical Informatics Association Published by Oxford University Press. https://academic.oup.com/jamia/advance-article-abstract/doi/10.1093/jamia/ocae122/7687618