中文

从海量多模态医学数据学习的临床概念嵌入

计算与语言 2019-08-21 v3 人工智能 机器学习

摘要

词嵌入是一种广泛用于自然语言处理中无监督学习词关系的热门方法。在本文中,我们提出一组利用极大量多模态医学数据学习得到的医学概念新嵌入。基于近期理论见解,我们展示了如何将含 6000 万成员的保险理赔数据库、2000 万份临床笔记集合以及 170 万篇全文生物医学期刊文章结合,将概念嵌入至公共空间,从而得到针对 108,477 个医学概念的有史以来最大嵌入集合。为评估我们的方法,我们提出一种基于统计功效、专为检验医学概念嵌入而设计的基准方法。我们称为 cui2vec 的方法在大多数情况下相对先前方法取得了 SOTA 性能。最后,我们提供了供其他研究者使用的预训练嵌入下载集,以及用于交互式探索 cui2vec 嵌入的在线工具。

关键词

引用

@article{arxiv.1804.01486,
  title  = {Clinical Concept Embeddings Learned from Massive Sources of Multimodal Medical Data},
  author = {Andrew L. Beam and Benjamin Kompa and Allen Schmaltz and Inbar Fried and Griffin Weber and Nathan P. Palmer and Xu Shi and Tianxi Cai and Isaac S. Kohane},
  journal= {arXiv preprint arXiv:1804.01486},
  year   = {2019}
}