中文

大型语言模型如何有效连接 SNP 变异与 ECG 表型用于心血管风险预测?

机器学习 2025-08-12 v1 基因组学

摘要

心血管疾病(CVD)预测因其多因素病因和全球范围的疾病负担而 remains a tremendous challenge。尽管基因组和心电图数据正在不断增加,但从高维、噪声大且标注稀疏的数据集中提取具有生物学意义的见解仍是非平凡的任务。最近,大型语言模型(LLM)已被有效应用于预测生物序列的结构变异。在本研究中,我们探讨了使用由高通量基因组分型数据派生的遗传标记,利用经过微调的LLM预测心血管疾病及可能导致CVD风险的SNP。我们研究了与心血管疾病相关的遗传模式,并评估了LLM如何从通过映射遗传特征(这些特征源自家族树)获得的结构化和准结构化基因组数据中学习隐式生物学关系。通过将问题定义为链式思考(CoT)推理任务,模型被提示生成疾病标签并在不同患者轮廓和表型之间阐述明确的临床推断。研究结果凸显了LLM在贡献于早期检测、风险评估以及最终推动心脏护理个性化医学进步方面的潜力。

关键词

引用

@article{arxiv.2508.07127,
  title  = {How Effectively Can Large Language Models Connect SNP Variants and ECG Phenotypes for Cardiovascular Risk Prediction?},
  author = {Niranjana Arun Menon and Iqra Farooq and Yulong Li and Sara Ahmed and Yutong Xie and Muhammad Awais and Imran Razzak},
  journal= {arXiv preprint arXiv:2508.07127},
  year   = {2025}
}