中文

NEMO: 从PubMed隶属机构字符串中提取和规范化组织名称

计算与语言 2011-07-29 v1

摘要

我们提出NEMO,一个从隶属机构中提取组织名称并将其规范化为规范组织名称的系统。我们的解析过程涉及多层规则匹配与多个词典。该系统在提取组织名称方面实现了超过98%的F值。我们的规范化过程包括基于局部序列比对度量的聚类和基于寻找连通分量的局部学习。在规范化中也观察到了高精度。NEMO是连接每篇生物医学论文及其作者与规范形式的组织名称以及组织地缘政治位置的关键环节。这项研究可能有助于分析大型组织社交网络以描绘特定主题、提高作者消歧性能、在作者合著网络中增加弱连接、增强NLM的MARS系统以纠正隶属机构字段OCR输出中的错误,以及使用规范化的组织名称和国家自动索引PubMed引文。我们的系统以图形用户界面形式提供,可随本文一起下载。

关键词

引用

@article{arxiv.1107.5743,
  title  = {NEMO: Extraction and normalization of organization names from PubMed affiliation strings},
  author = {Siddhartha Jonnalagadda and Philip Topham},
  journal= {arXiv preprint arXiv:1107.5743},
  year   = {2011}
}