中文

通过考虑不同共病程度改进基于 ICD 的语义相似度

机器学习 2023-08-16 v1 信息检索

摘要

寻找相似患者是精准医学中的常见目标,有助于治疗效果评估与临床决策支持。选择广泛可用的患者特征与恰当的相似度计算方法至关重要。国际疾病与相关健康问题统计分类(ICD)码在全球用于编码疾病,几乎对所有患者均可获得。将其聚合为由主要和次要诊断组成的集合可显示共病程度并揭示共病模式。利用语义相似度算法基于 ICD 码计算患者相似度成为可能。这些算法传统上使用单项专家评级数据集评估。然而,真实世界患者数据常表现出不同程度的已记录共病,可能损害算法性能。为此,我们提出一个考虑已记录共病方差的尺度项。本工作中,我们比较了基于 ICD 码集合的 80 种已有算法组合在语义相似度上的表现。这些集合提取自以 C25.X(胰腺癌)为主要诊断的患者,并提供多种不同的 ICD 码组合。使用我们的尺度项,基于层级信息内容、Leacock & Chodorow 概念相似度与二部图匹配的集合相似度组合取得了最佳结果,与专家真值的相关性达 0.75。我们的结果凸显了考虑共病方差的重要性,同时展示了当前语义相似度算法的良好表现。

关键词

引用

@article{arxiv.2308.07359,
  title  = {Improving ICD-based semantic similarity by accounting for varying degrees of comorbidity},
  author = {Jan Janosch Schneider and Marius Adler and Christoph Ammer-Herrmenau and Alexander Otto König and Ulrich Sax and Jonas Hügel},
  journal= {arXiv preprint arXiv:2308.07359},
  year   = {2023}
}

备注

11 pages, 6 figures, 1 table