中文

生物医学概念相关性——一个基于电子健康档案的大型基准

计算与语言 2020-11-02 v1 人工智能 信息检索 机器学习

摘要

人工智能在医疗领域的一个有前景的应用是从电子健康档案(EHRs)中检索信息,例如帮助临床医生查找会诊的相关信息或为研究招募合适的患者。这需要远超简单字符串匹配的搜索能力,包括检索与所关注概念(诊断、症状、药物等)相关的概念。人工智能方法对此类应用的适用性通过预测具有已知相关性分数的概念的相关性来检验。然而,所有现有的生物医学概念相关性数据集都出了名地小,且由人工挑选的概念对组成。我们开源了一个克服这些问题的新型概念相关性基准:它比现有数据集大六倍,且概念对基于在EHRs中的共现来选择,确保了它们对目标应用的相关性。我们对新数据集进行了深入分析,并将其与现有数据集进行比较,强调它不仅更大,而且在所包含概念的类型方面补充了现有数据集。使用最先进的嵌入方法的初步实验表明,我们的数据集是测试概念相关性模型的一个具有挑战性的新基准。

关键词

引用

@article{arxiv.2010.16218,
  title  = {Biomedical Concept Relatedness -- A large EHR-based benchmark},
  author = {Claudia Schulz and Josh Levy-Kramer and Camille Van Assel and Miklos Kepes and Nils Hammerla},
  journal= {arXiv preprint arXiv:2010.16218},
  year   = {2020}
}

备注

Accepted for publication at the 28th International Conference on Computational Linguistics (COLING 2020)