基于 BERT 在机器阅读理解框架下的生物医学命名实体识别
计算与语言
2021-05-18 v2
摘要
从文献中识别生物医学实体是一项具有挑战性的研究重点,是将存在于非结构化文本中的大量生物医学知识提取为结构化格式的基础。使用序列标注框架实现生物医学命名实体识别(BioNER)目前是常规方法。然而,该方法往往不能充分利用数据集中的语义信息,性能并不总是令人满意。在这项工作中,我们不再将 BioNER 任务视为序列标注问题,而是将其表述为机器阅读理解(MRC)问题。该表述可利用精心设计的查询引入更多先验知识,且不再需要条件随机场(CRF)等解码过程。我们在六个 BioNER 数据集上开展实验,实验结果证明了方法的有效性。我们的方法在 BC4CHEMD、BC5CDR-Chem、BC5CDR-Disease、NCBI-Disease、BC2GM 和 JNLPBA 数据集上取得了当前最优(SOTA)性能,F1 分数分别为 92.92%、94.19%、87.83%、90.04%、85.48% 和 78.93%。
引用
@article{arxiv.2009.01560,
title = {Biomedical named entity recognition using BERT in the machine reading comprehension framework},
author = {Cong Sun and Zhihao Yang and Lei Wang and Yin Zhang and Hongfei Lin and Jian Wang},
journal= {arXiv preprint arXiv:2009.01560},
year = {2021}
}