中文

应用深度学习技术于万维网医学语料库:原型系统与评估

计算与语言 2015-02-13 v1 信息检索 机器学习 神经与进化计算

摘要

背景:生物医学文献数量快速增长,手动策划的知识库和本体保持更新日益困难。本研究将word2vec深度学习工具包应用于医学语料库,以测试其从非结构化文本识别关系的潜力。我们评估了word2vec在基于网络上可用的中等规模非结构化医学文本语料库识别药物特性的效率。特性包括与疾病的关系('may treat')或与生理过程的关系('has physiological effect')。我们将word2vec识别的关系与来自National Drug File - Reference Terminology (NDF-RT)本体的手动策划信息作为金标准进行比较。结果:我们的结果揭示了最大准确率49.28%,表明与其他已发表结果相比,word2vec在收集的医学语料库上捕获语言规律的能力有限。我们能够记录不同参数设置对结果准确率的影响,并发现排序质量与准确率之间未预期的权衡。预处理语料库以减少句法变异性被证明是提高训练向量模型效用的好策略。结论:word2vec是用于计算向量表示的高效实现,并且能够在没有任何先验领域知识的情况下识别文本数据中的关系。我们发现word2vec生成的排序和检索结果质量不足以自动填充知识库和本体,但可作为进一步手动策划的起点。

关键词

引用

@article{arxiv.1502.03682,
  title  = {Applying deep learning techniques on medical corpora from the World Wide Web: a prototypical system and evaluation},
  author = {Jose Antonio Miñarro-Giménez and Oscar Marín-Alonso and Matthias Samwald},
  journal= {arXiv preprint arXiv:1502.03682},
  year   = {2015}
}