中文

通过学习目标概念嵌入实现用户生成文本中的医学概念归一化

计算与语言 2020-06-09 v1

摘要

医学概念归一化有助于在自由文本中发现标准概念,即将健康相关提及映射到词汇表中的标准概念。它远不止简单的字符串匹配,而是需要对概念提及有深入的语义理解。近期研究将概念归一化视为文本分类或文本匹配。现有方法的缺陷在于:a) 文本分类方法忽视了在学习输入概念提及表示时有价值的目标概念信息;b) 文本匹配方法需单独生成目标概念嵌入,耗时耗资源。我们提出的模型通过联合学习输入概念提及与目标概念的表示克服了这些缺陷。首先,使用 RoBERTa 学习输入概念提及表示。其次,计算输入概念提及与所有目标概念的嵌入间的余弦相似度。此处目标概念嵌入随机初始化并在训练中更新。最后,将余弦相似度最大的目标概念赋给输入概念提及。我们的模型在三个标准数据集上以最高 2.31% 的准确率提升超越了所有现有方法。

关键词

引用

@article{arxiv.2006.04014,
  title  = {Medical Concept Normalization in User Generated Texts by Learning Target Concept Embeddings},
  author = {Katikapalli Subramanyam Kalyan and S. Sangeetha},
  journal= {arXiv preprint arXiv:2006.04014},
  year   = {2020}
}

备注

5 pages