中文

GPT-3 模型在生物医学领域是薄弱的少样本学习器

计算与语言 2022-06-02 v2 人工智能 机器学习

摘要

深度神经语言模型已在自然语言处理(NLP)的许多任务中取得新的突破。近期工作表明,深度 transformer 语言模型(在大量文本上预训练)能够实现高水平的任务特定少样本性能,可与最先进模型相媲美。然而,这些大语言模型在少样本迁移学习中的能力尚未在生物医学领域得到探索。我们研究了两个强大的 transformer 语言模型,即 GPT-3 与 BioBERT,在各种生物医学 NLP 任务的少样本设定下的性能。实验结果表明,在很大程度上,两个模型都逊于在全量训练数据上微调的语言模型。尽管 GPT-3 在开放领域 NLP 任务的少样本知识迁移中已取得接近最先进的结果,但它无法像 BioBERT 那样有效,而 BioBERT 的参数量比 GPT-3 小几个数量级。鉴于 BioBERT 已在大型生物医学文本语料库上预训练,我们的研究表明语言模型在任务特定少样本学习中可能大幅受益于领域内预训练。然而,领域内预训练似乎并不充分;生物医学 NLP 领域需要新颖的预训练与少样本学习策略。

关键词

引用

@article{arxiv.2109.02555,
  title  = {GPT-3 Models are Poor Few-Shot Learners in the Biomedical Domain},
  author = {Milad Moradi and Kathrin Blagec and Florian Haberl and Matthias Samwald},
  journal= {arXiv preprint arXiv:2109.02555},
  year   = {2022}
}