中文

当专业化有帮助时:使用池化上下文嵌入检测西班牙语中的化学与生物医学实体

计算与语言 2019-10-09 v1 机器学习

摘要

药物物质、化合物与蛋白质的识别是识别化学物质与其他生物医学相关单元之间关系的必要前期工作。在本文中,我们描述了针对 PharmaCoNER 挑战赛任务 1 的方法,该任务涉及西班牙语医学文本中化学与药物提及的识别。我们使用开源框架 FLAIR,以堆叠的池化上下文嵌入(Pooled Contextualized Embeddings)、词与子词嵌入训练了一个最先进的 BiLSTM-CRF 序列标注器。我们提出了一个由西班牙健康科学期刊的文章与论文组成的新语料库,称为西班牙健康语料库(Spanish Health Corpus),并用其训练领域特定嵌入,将其纳入我们的模型训练中。我们使用预训练嵌入取得了 89.76% F1 值的结果,并能够利用专业化嵌入将这些结果提升至 90.52% F1 值。

关键词

引用

@article{arxiv.1910.03387,
  title  = {When Specialization Helps: Using Pooled Contextualized Embeddings to Detect Chemical and Biomedical Entities in Spanish},
  author = {Manuel Stoeckel and Wahed Hemati and Alexander Mehler},
  journal= {arXiv preprint arXiv:1910.03387},
  year   = {2019}
}

备注

EMNLP-IJCNLP 2019: International Workshop on BioNLP Open Shared Tasks 2019, 5, pages, 1 figure