利用上下文词嵌入改进专利中的化学物质命名实体识别
计算与语言
2019-07-08 v1
摘要
化学专利是化学信息的重要资源。然而,由于专利文档在结构和语言上的复杂性,很少有化学命名实体识别 (NER) 系统在专利文档上接受过评估。在本文中,我们探索了利用预训练词嵌入、字符级词表示以及针对化学专利的上下文 ELMo 词表示的 BiLSTM-CRF 模型的 NER 性能。我们比较了在生物医学语料库和化学专利语料库上预训练的词嵌入。同时还探讨了为化学领域优化的分词器对化学专利中 NER 性能的影响。在两个专利语料库上的结果表明,由 ELMo 生成的上下文词表示相较于当前最优水平显著提升了化学 NER 性能。我们还表明,诸如在化学专利上训练的词嵌入和化学物质专用分词器等领域特定资源对 NER 性能有正向影响。
引用
@article{arxiv.1907.02679,
title = {Improving Chemical Named Entity Recognition in Patents with Contextualized Word Embeddings},
author = {Zenan Zhai and Dat Quoc Nguyen and Saber A. Akhondi and Camilo Thorne and Christian Druckenbrodt and Trevor Cohn and Michelle Gregory and Karin Verspoor},
journal= {arXiv preprint arXiv:1907.02679},
year = {2019}
}