中文

一种基于训练数据特征的新数据表示方法用于医学文本中的药物命名实体抽取

计算与语言 2016-10-07 v1 人工智能 机器学习 神经与进化计算

摘要

从医学语料库中进行信息抽取的一项基本任务是药物名称识别。与其他领域的文本来源相比,医学文本具有特殊性及独特特征。此外,医学文本挖掘面临更多挑战,例如更大量的非结构化文本、新术语的快速增长、同一药物的名称变体范围广泛。由于缺乏标注数据集来源和外部知识,以及单一药物名称在真实应用场景中更常见的多种标记表示形式,挖掘任务更具挑战性。尽管已有许多方法被提出以应对该任务,但一些问题仍然存在,F-score性能较差(低于0.75)。本文提出了一种新的数据表示技术处理方法以克服其中一些挑战。我们基于词分布特征和词嵌入训练所得的词相似性,提出了三种数据表示技术。第一种技术使用标准神经网络模型MLP(多层感知器)进行评估。第二种技术涉及两个深度网络分类器,即DBN(深度置信网络)和SAE(堆叠去噪编码器)。第三种技术将句子表示为序列,并使用循环神经网络模型LSTM(长短期记忆网络)进行评估。在抽取药物名称实体时,第三种技术相比现有最佳方法给出了最好的F-score性能,其平均F-score达到0.8645。

关键词

引用

@article{arxiv.1610.01891,
  title  = {A New Data Representation Based on Training Data Characteristics to Extract Drug Named-Entity in Medical Text},
  author = {Sadikin Mujiono and Mohamad Ivan Fanany and Chan Basaruddin},
  journal= {arXiv preprint arXiv:1610.01891},
  year   = {2016}
}

备注

Hindawi Publishing. Computational Intelligence and Neuroscience Volume 2016 (2016), Article ID 3483528, 24 pages Received 27 May 2016; Revised 8 August 2016; Accepted 18 September 2016. Special Issue on "Smart Data: Where the Big Data Meets the Semantics". Academic Editor: Trong H. Duong