基于 BERT 的生物医学实体归一化排序
信息检索
2019-08-12 v1 计算与语言
机器学习
摘要
开发能够缓解术语变异问题的高性能实体归一化算法对生物医学界具有重大价值。尽管基于深度学习的方法已成功应用于生物医学实体归一化,它们常依赖于传统的上下文无关词嵌入。双向 Transformer 编码器表示(BERT)、面向生物医学文本挖掘的 BERT(BioBERT)和面向临床文本挖掘的 BERT(ClinicalBERT)近期被引入,以使用双向 Transformer 预训练上下文化词表示模型,推动了诸多自然语言处理任务的最先进水平。在本研究中,我们通过微调预训练的 BERT / BioBERT / ClinicalBERT 模型提出一种实体归一化架构,并利用三类不同数据集进行了大量实验以评估预训练模型在生物医学实体归一化中的有效性。实验结果表明,最佳微调模型一致优于先前方法,并将生物医学实体归一化的最先进水平向前推进,准确率最高提升 1.17%。
引用
@article{arxiv.1908.03548,
title = {BERT-based Ranking for Biomedical Entity Normalization},
author = {Zongcheng Ji and Qiang Wei and Hua Xu},
journal= {arXiv preprint arXiv:1908.03548},
year = {2019}
}
备注
9 pages, 1 figure, 4 tables