中文

揭示疾病间的相互关联:从统计方法到大语言模型

机器学习 2025-10-13 v2 人工智能

摘要

通过手动分析大规模临床数据来识别疾病间的相互关联极其费时、主观且容易导致专家间意见不一致。虽然机器学习 (ML) 显示出潜力,但仍面临三个关键挑战:(1) 从广泛的 ML 图景中选择最佳方法;(2) 确定真实世界临床数据(如电子健康记录 EHR)或结构化疾病描述是否提供更可靠的见解;(3) 缺乏“真实答案”,因为某些疾病相互关联在医学上尚未探索。大语言模型 (LLM) 显示出广泛用途,但常缺乏专业医学知识。为此,我们对七种基于两种数据来源(i)来自 MIMIC-IV EHR 的 ICD-10 代码序列,和 ii)完整 ICD-10 代码集合(带或不带文本描述)的七种方法进行系统评估。我们的框架集成了以下内容:(i) 统计共现分析和基于真实临床数据的遮蔽语言模型 (MLM) 方法;(ii) 领域特定 BERT 变体(Med-BERT 和 BioClinicalBERT);(iii) 通用 BERT 和文档检索;以及 (iv) 四个大语言模型(Mistral、DeepSeek、Qwen 和 YandexGPT)。我们的图基于比较获取的相互关联矩阵,显示 LLM 基于的方法在 ICD 代码与不同疾病的连接方面产生的相互关联性最低多样性,包括文本基于和领域基于方法。这表明一个重要含义:LLM 在发现新的相互关联方面的潜力有限。由于缺乏医学 ICD 代码之间相互关联的真实数据库,我们的结果构成了可为未来临床研究和人工智能在医疗保健中的应用提供基础资源的有价值的医学疾病本体。

关键词

引用

@article{arxiv.2510.04888,
  title  = {Revealing Interconnections between Diseases: from Statistical Methods to Large Language Models},
  author = {Alina Ermilova and Dmitrii Kornilov and Sofia Samoilova and Ekaterina Laptenkova and Anastasia Kolesnikova and Ekaterina Podplutova and Senotrusova Sofya and Maksim G. Sharaev},
  journal= {arXiv preprint arXiv:2510.04888},
  year   = {2025}
}