中文

面向生物医学自然语言处理的词嵌入比较

信息检索 2018-07-20 v3

摘要

词嵌入已广泛用于生物医学自然语言处理(NLP)应用,因为它们提供捕获词语语义属性及词间语言关系的词向量表示。许多生物医学应用使用不同文本资源(如 Wikipedia 与生物医学文献)训练词嵌入,并将这些词嵌入应用于下游生物医学任务。然而,关于评估从这些资源训练的词嵌入的工作甚少。在本研究中,我们对从四种不同资源(即临床笔记、生物医学出版物、Wikipedia 与新闻)训练的词嵌入提供经验性评估。我们进行了定性与定量评估。对于定性评估,我们人工检查了给定目标医学词集合的五个最相似医学词,并通过这些词嵌入的可视化进行分析。对于定量评估,我们进行了内在与外在评估。基于评估结果,我们得出如下结论。第一,与基于 Wikipedia 和新闻训练的词嵌入相比,在临床笔记与生物医学出版物上训练的词嵌入能更好地捕获医学术语语义,找到更相关的相似医学词,且更接近于人类专家判断。第二,对于下游生物医学 NLP 应用,不存在一致的词嵌入质量全局排序。然而,将词嵌入作为额外特征添加可改善多数下游任务的结果。最后,对于任一下游生物医学 NLP 任务,在生物医学领域语料上训练的词嵌入未必优于在其他通用领域语料上训练者。

关键词

引用

@article{arxiv.1802.00400,
  title  = {A Comparison of Word Embeddings for the Biomedical Natural Language Processing},
  author = {Yanshan Wang and Sijia Liu and Naveed Afzal and Majid Rastegar-Mojarad and Liwei Wang and Feichen Shen and Paul Kingsbury and Hongfang Liu},
  journal= {arXiv preprint arXiv:1802.00400},
  year   = {2018}
}