生物医学命名实体识别:挑战与对策
计算与语言
2021-06-24 v1
摘要
生物医学文献数量的增长速度令人震惊。释放这些文献中蕴含的信息,可使研究人员和从业者能够在信息世界中自信地开展工作。生物医学命名实体识别(biomedical NER),即识别生物医学名称的任务,通常作为自然语言处理(NLP)流程的第一步。基于序列标注技术的标准 NER 模型擅长识别通用领域中的短实体指称。然而,将这些模型应用于识别生物医学名称时存在若干开放性挑战:1)生物医学名称可能包含复杂的内部结构(不连续与重叠),无法使用标准序列标注技术识别;2)NER 模型的训练通常需要大量标注数据,而在生物医学领域难以获取;以及 3)常用的语言表示模型在通用数据上预训练,因此这些模型与目标生物医学数据之间存在领域偏移。为应对这些挑战,我们探索了若干研究方向并作出以下贡献:1)我们提出一种基于转移的 NER 模型,可识别不连续指称;2)我们开发了一种成本有效的方法,用于遴选合适的预训练数据;以及 3)我们设计了若干面向 NER 的数据增强方法。我们的贡献具有明显的实际意义,尤其是在需要新的生物医学应用时。我们提出的数据增强方法仅需少量标注数据即可帮助 NER 模型取得良好性能。我们关于预训练数据选择的探究可通过引入使用领域内数据预训练的语言表示模型来改进模型。最后,我们提出的基于转移的 NER 模型可通过识别不连续指称进一步提升性能。
引用
@article{arxiv.2106.12230,
title = {Recognising Biomedical Names: Challenges and Solutions},
author = {Xiang Dai},
journal= {arXiv preprint arXiv:2106.12230},
year = {2021}
}
备注
PhD thesis, University of Sydney