中文

领域特异性在语言模型和指令微调中对生物医学关系抽取有多重要?

计算与语言 2025-07-28 v2

摘要

通用自然语言处理领域开发的前沿技术通常随后被应用于高价值、数据丰富的生物医学领域。过去几年,生成式语言模型(LM)、指令微调和少样本学习已成为NLP研究的焦点。因此,在生物医学语料库上预训练的生成式LM大量涌现,生物医学指令微调也已被尝试,所有这些都是希望领域特异性能够提高下游任务的性能。鉴于训练此类模型需要大量努力,我们研究了它们在关键生物医学NLP任务——关系抽取中是否具有任何优势。具体而言,我们解决两个问题:(1)在生物医学语料库上训练的LM是否优于在通用领域语料库上训练的LM?(2)在生物医学数据集上进行指令微调的模型是否优于在混合数据集上微调的模型或仅预训练的模型?我们使用现有LM在四个数据集上进行测试来回答这些问题。一个令人惊讶的结果是,通用领域模型通常优于生物医学领域模型。然而,生物医学指令微调在性能提升程度上与通用指令微调相似,尽管其指令数量少几个数量级。我们的发现表明,将研究重点放在对通用LM进行更大规模的生物医学指令微调上,可能比构建领域特定的生物医学LM更有成效。

关键词

引用

@article{arxiv.2402.13470,
  title  = {How Important is Domain Specificity in Language Models and Instruction Finetuning for Biomedical Relation Extraction?},
  author = {Aviv Brokman and Ramakanth Kavuluru},
  journal= {arXiv preprint arXiv:2402.13470},
  year   = {2025}
}

备注

A version of this paper has appeared in the proceedings of NLDB 2025 with a slightly different title. The corresponding DOI is also listed below in the metadata