基于词典同义泛化的生物医学命名实体识别
计算与语言
2023-10-16 v2 人工智能
摘要
生物医学命名实体识别是生物医学自然语言处理(BioNLP)的核心任务之一。为解决该任务,已提出大量有监督/远程监督方法。尽管取得显著成功,这些方法不可避免地需要繁重的人力。为缓解人力需求,基于词典的方法被提出以仅依据给定词典抽取命名实体。然而,现有基于词典方法的一个缺陷是难以识别未列于给定词典中的概念同义词,我们称之为同义泛化问题。在本研究中,我们提出一种新颖的同义泛化(SynGen)框架,利用基于跨度的预测来识别输入文本中包含的生物医学概念。具体而言,SynGen 引入两项正则项,即(1)同义词距离正则化项;和(2)噪声扰动正则化项,以最小化同义泛化误差。为证明方法有效性,我们给出了同义泛化误差界的理论分析。我们在广泛基准上进行了充分评估,结果验证了 SynGen 以显著优势超越以往的基于词典模型。最后,我们提供详细分析以进一步揭示方法的优势与内在机制。
引用
@article{arxiv.2305.13066,
title = {Biomedical Named Entity Recognition via Dictionary-based Synonym Generalization},
author = {Zihao Fu and Yixuan Su and Zaiqiao Meng and Nigel Collier},
journal= {arXiv preprint arXiv:2305.13066},
year = {2023}
}