中文

用于肺癌预测的临床语义

机器学习 2025-08-21 v1

摘要

背景:现有的临床预测模型通常使用忽略临床概念间语义关系的特征来表示患者数据。本研究通过将SNOMED医学术语层级结构映射到低维双曲空间(使用庞加莱嵌入),整合了领域特定的语义信息,旨在改善肺癌发病预测。方法:使用来自Optum EHR数据集的回顾性队列,我们从SNOMED分类法导出了临床知识图谱,并通过黎曼随机梯度下降生成了庞加莱嵌入。然后将这些嵌入整合到两种深度学习架构中:ResNet和Transformer模型。对模型的区分度(受试者工作特征曲线下面积)和校准度(观测概率与预测概率之间的平均绝对差)性能进行了评估。结果:与使用随机初始化的欧几里得嵌入的基线模型相比,整合预训练的庞加莱嵌入在区分度性能上带来了适度且一致的提升。ResNet模型,特别是那些使用10维庞加莱嵌入的模型,显示出增强的校准度,而Transformer模型在不同配置下保持了稳定的校准度。讨论:将临床知识图谱嵌入到双曲空间并将这些表示整合到深度学习模型中,可以通过保留用于预测的临床术语的层级结构来改善肺癌发病预测。该方法展示了一种将数据驱动的特征提取与既定临床知识相结合的可行方法。

关键词

引用

@article{arxiv.2508.14627,
  title  = {Clinical semantics for lung cancer prediction},
  author = {Luis H. John and Jan A. Kors and Jenna M. Reps and Peter R. Rijnbeek and Egill A. Fridgeirsson},
  journal= {arXiv preprint arXiv:2508.14627},
  year   = {2025}
}