中文

你的生物医学命名实体识别模型如何泛化至新实体?

计算与语言 2022-03-15 v3

摘要

关于新生物医学概念的文献数量正在迅速增长,这需要可靠生物医学命名实体识别(BioNER)模型来识别新的和未见的实体提及。然而,现有模型能否有效处理它们仍存疑问。在本工作中,我们系统分析了 BioNER 模型的三种识别能力:记忆、同义泛化与概念泛化。我们发现,尽管当前最佳模型在基于整体性能的基准上达到了最先进水平(SOTA),但其在识别同义词和新生物医学概念方面存在局限,表明它们的泛化能力被高估了。我们还调查了模型的失败案例,并识别出生物医学文献中识别未见提及的几项困难:(1)模型倾向于利用数据集偏差,这阻碍了模型的泛化能力;(2)若干生物医学名称具有弱名称规律性的新颖形态模式,模型无法识别它们。我们采用一种基于统计的去偏方法作为简单补救,并展示了其对未见提及泛化的改进。我们希望我们的分析与发现能够促进在可靠性至关重要的领域中 NER 模型泛化能力的进一步研究。

关键词

引用

@article{arxiv.2101.00160,
  title  = {How Do Your Biomedical Named Entity Recognition Models Generalize to Novel Entities?},
  author = {Hyunjae Kim and Jaewoo Kang},
  journal= {arXiv preprint arXiv:2101.00160},
  year   = {2022}
}

备注

IEEE Access 2022