BioFLAIR:用于生物医学序列标注任务的预训练池化上下文嵌入
计算与语言
2019-08-19 v1
摘要
生物医学命名实体识别(NER)因脱离上下文术语的广泛歧义以及大量的词汇变体而成为生物医学信息处理中的一项挑战性任务。由于 BERT、GPT 和 XLNet 等进展,bioNER 基准上的性能持续提升。FLAIR (1) 是一种替代性嵌入模型,其计算强度低于上述其他模型。我们在多种 bio NER 任务上测试了 FLAIR 及其预训练的 PubMed 嵌入(我们称之为 BioFLAIR),并将结果与 BERT 类网络进行比较。我们还研究了在 PubMed 内容上进行少量额外预训练以及组合 FLAIR 与 ELMO 模型的效果。我们发现,使用所提供的嵌入,FLAIR 表现与 BERT 网络相当——甚至在一个基准上确立了新的 state of the art。额外预训练未带来明显收益,尽管若进行更多预训练这一点可能改变。将 FLAIR 嵌入与其他嵌入堆叠通常确实会提升基准结果。
引用
@article{arxiv.1908.05760,
title = {BioFLAIR: Pretrained Pooled Contextualized Embeddings for Biomedical Sequence Labeling Tasks},
author = {Shreyas Sharma and Ron Daniel},
journal= {arXiv preprint arXiv:1908.05760},
year = {2019}
}