中文

基于 RNN 的用户生成文本中医疗概念归一化序列学习

计算与语言 2018-11-30 v2 信息检索

摘要

在这项工作中,我们考虑医疗概念归一化问题,即把自由文本中的疾病提及映射到受控词汇表中的概念,通常映射到统一医学语言系统(UMLS)的标准词库。该任务具有挑战性,因为来自医疗专业人员或社交媒体文本中普通公众的医学术语差异很大。我们将其视为序列学习问题,训练循环神经网络以获得单词和多词表达的语义表示。我们开发了专门面向医疗概念归一化的端到端神经架构,包括带注意力机制的双向 LSTM 和 GRU,以及基于 UMLS 的额外语义相似度特征。我们在标准基准上的评估表明,我们的模型优于基于 CNN 的 SOTA 分类基线。

关键词

引用

@article{arxiv.1811.11523,
  title  = {Sequence Learning with RNNs for Medical Concept Normalization in User-Generated Texts},
  author = {Elena Tutubalina and Zulfat Miftahutdinov and Sergey Nikolenko and Valentin Malykh},
  journal= {arXiv preprint arXiv:1811.11523},
  year   = {2018}
}

备注

Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216