中文

基于大语言模型的少标签多模态 SNP 变异和 ECG 表型建模:心血管风险分层

定量方法 2025-10-21 v1 人工智能 机器学习

摘要

心血管疾病(CVD)风险分层仍是一个主要挑战,由于其多因素性质以及高质量标注数据集获取受限的限制。尽管基因组数据和电生理数据如 SNP 变异和 ECG 表型日益可获取,但在少标签设置下有效整合这些模态数据仍然具有挑战性。这一挑战源于高质量多模态数据集稀缺以及生物信号的高维度,这些因素限制了常规监督模型的有效性。为此,我们提出了一个少标签多模态框架,利用大语言模型(LLM)将基因和电生理信息整合用于心血管风险分层。我们的方法包含一种伪标签精炼策略,用于从弱监督预测中自适应提取高置信度标签,从而仅使用小量真实标注即可实现稳健的模型微调。为增强可解释性,我们将任务表述为链式思考(CoT)推理问题,引导模型在预测的同时生成临床相关的理由。实验结果表明,多模态输入、少标签监督和 CoT 推理的集成提高了模型在不同患者档案中的鲁棒性和可泛化性。使用多模态 SNP 变异和 ECG 提取特征的实验结果表明,性能相当于在完整数据集上训练的模型,这凸显了 LLM 基于少标签多模态建模在推动个性化心血管护理方面的潜力。

关键词

引用

@article{arxiv.2510.16536,
  title  = {Few-Label Multimodal Modeling of SNP Variants and ECG Phenotypes Using Large Language Models for Cardiovascular Risk Stratification},
  author = {Niranjana Arun Menon and Yulong Li and Iqra Farooq and Sara Ahmed and Muhammad Awais and Imran Razzak},
  journal= {arXiv preprint arXiv:2510.16536},
  year   = {2025}
}