中文

使用大型语言模型对儿科败血症队列进行情境化表型分析

定量方法 2025-08-05 v1 人工智能 计算与语言 机器学习 应用统计

摘要

聚类患者子群对于个性化护理和高效资源利用至关重要。传统聚类方法在处理高维、异质性医疗数据时存在困难,并且缺乏语境理解。本研究使用来自低收入国家(LIC)的儿科败血症数据集(包含2,686条记录和28个数值变量及119个分类变量),评估了基于大型语言模型(LLM)的聚类方法与经典方法的对比。患者记录被序列化为文本,有无聚类目标。使用量化LLAMA 3.1 8B、DeepSeek-R1-Distill-Llama-8B(带低秩适应LoRA)和Stella-En-400M-V5模型生成嵌入。对这些嵌入应用K-means聚类。经典对比方法包括在UMAP和FAMD降维后的混合数据上进行K-Medoids聚类。轮廓系数和统计检验用于评估聚类质量和区分度。Stella-En-400M-V5取得了最高的轮廓系数(0.86)。带聚类目标的LLAMA 3.1 8B在更多聚类数下表现更好,识别出具有不同营养、临床和社会经济特征的子群。LLM方法通过捕捉更丰富的语境和优先关键特征,优于经典技术。这些结果突显了LLM在资源有限环境中进行情境化表型分析和知情决策的潜力。

关键词

引用

@article{arxiv.2505.09805,
  title  = {Contextual Phenotyping of Pediatric Sepsis Cohort Using Large Language Models},
  author = {Aditya Nagori and Ayush Gautam and Matthew O. Wiens and Vuong Nguyen and Nathan Kenya Mugisha and Jerome Kabakyenga and Niranjan Kissoon and John Mark Ansermino and Rishikesan Kamaleswaran},
  journal= {arXiv preprint arXiv:2505.09805},
  year   = {2025}
}

备注

11 pages, 2 Figures, 1 Table