中文

从零到英雄:在零样本与少样本场景下利用Transformers进行生物医学命名实体识别

计算与语言 2024-08-27 v5 人工智能 信息检索

摘要

生物医学领域中的有监督命名实体识别(NER)依赖于带有给定命名实体的大型标注文本集。此类数据集的创建耗时且昂贵,而提取新实体需要额外的标注任务并重新训练模型。为应对这些挑战,本文提出一种生物医学领域零样本与少样本NER方法。该方法基于将多类 token 分类任务转化为二分类 token 分类,并在大量数据集和生物医学实体上预训练,使模型学习给定与潜在新颖命名实体标签间的语义关系。我们在9个不同评估生物医学实体上,使用微调的基于PubMedBERT的模型,取得了零样本NER平均F1分数35.44%、单样本NER 50.10%、10样本NER 69.94%、100样本NER 79.51%。结果证明了所提方法在无需或极少示例下识别新生物医学实体的有效性,优于先前基于transformer的方法,并与基于GPT3的模型相当,而所用模型参数少逾1000倍。我们公开了模型与开发代码。

关键词

引用

@article{arxiv.2305.04928,
  title  = {From Zero to Hero: Harnessing Transformers for Biomedical Named Entity Recognition in Zero- and Few-shot Contexts},
  author = {Miloš Košprdić and Nikola Prodanović and Adela Ljajić and Bojana Bašaragin and Nikola Milošević},
  journal= {arXiv preprint arXiv:2305.04928},
  year   = {2024}
}

备注

Collaboration between Bayer Pharma R&D and Serbian Institute for Artificial Intelligence Research and Development. Artificial Intelligence in Medicine (2024)