利用大语言模型从异构数据中进行自适应心血管疾病风险预测
人工智能
2025-06-02 v1 机器学习
摘要
心血管疾病(CVD)风险预测模型对于识别高风险个体和指导预防措施至关重要。然而,现有模型难以应对真实世界临床实践中的挑战,因为它们过度简化了患者特征、依赖僵化的输入模式,且对分布漂移敏感。我们开发了 AdaCVD,这是一个建立在大型语言模型基础上的自适应 CVD 风险预测框架,该模型基于英国生物样本库中超过五十万名参与者的数据进行了广泛微调。在基准比较中,AdaCVD 超越了既有的风险评分和标准机器学习方法,取得了最先进的性能。至关重要的是,它首次从三个维度解决了关键的临床挑战:灵活地纳入全面但多变的病人信息;无缝整合结构化数据和非结构化文本;并使用最少的额外数据快速适应新的患者群体。在分层分析中,它在人口统计学、社会经济和临床亚组中表现出稳健的性能,包括代表性不足的群体。AdaCVD 为更灵活的、由 AI 驱动的临床决策支持工具提供了一条有前景的路径,这些工具适应于异构和动态医疗环境的现实。
引用
@article{arxiv.2505.24655,
title = {Adaptable Cardiovascular Disease Risk Prediction from Heterogeneous Data using Large Language Models},
author = {Frederike Lübeck and Jonas Wildberger and Frederik Träuble and Maximilian Mordig and Sergios Gatidis and Andreas Krause and Bernhard Schölkopf},
journal= {arXiv preprint arXiv:2505.24655},
year = {2025}
}