中文

流行病学文章中的地名识别——一种深度学习方法

计算与语言 2019-04-30 v2

摘要

在分析病毒传播时,流行病学家常需确定受感染宿主的位置。该信息可在公共数据库(如 GenBank)中找到,然而这些数据库提供的信息通常仅限于国家或州级别。更细粒度的定位信息需要系统地理学家手动阅读相关科学文章。本工作中我们提出一种从医学(流行病学)文章中自动进行地名识别的方法。本文重点提出一种基于深度学习的地名检测模型,并试验外部语言特征和领域特定信息的使用。该模型使用近期 SemEval 任务 12 提供的来自 PubMed Central 的 105 篇流行病学文章集合进行评估。我们最佳检测模型取得 80.13%80.13\% 的 F1 分数,相较 69.84%69.84\% 的当前最优水平有显著提升。这些结果凸显了领域特定嵌入以及特定语言特征在医学期刊地名检测中的重要性。

关键词

引用

@article{arxiv.1904.11018,
  title  = {Toponym Identification in Epidemiology Articles - A Deep Learning Approach},
  author = {MohammadReza Davari and Leila Kosseim and Tien D. Bui},
  journal= {arXiv preprint arXiv:1904.11018},
  year   = {2019}
}

备注

12 pages. pre-print from Proceedings of CICLing 2019: 20th International Conference on Computational Linguistics and Intelligent Text Processing