中文

基于视觉语言融合和大语言模型的慢性病多模态健康风险预测系统

人工智能 2025-09-24 v1 机器学习

摘要

随着全球慢性病负担的不断增加,以及医学影像、自由文本记录、可穿戴传感器流等多模态异构临床数据的不断增长,迫切需要一种统一的多模态AI框架,能够主动预测个体的健康风险。我们提出了VL-RiskFormer,一种具有层次结构的堆叠式视觉语言多模态Transformer,其顶层嵌入了大语言模型(LLM)推理头。该系统基于现有视觉语言模型(如PaLM-E、LLaVA)的双流架构,包含四项关键创新:(i)通过动量更新编码器和去偏InfoNCE损失,对放射科学影像、眼底图和可穿戴设备照片与相应临床叙述进行跨模态比较和细粒度对齐进行预训练;(ii)一种时间融合模块,通过自适应时间间隔位置编码,将不规则就诊序列整合到因果Transformer解码器中;(iii)一种疾病本体图适配器,通过图注意力机制在各层注入ICD-10编码,以辅助推断共病模式。在MIMIC-IV纵向队列数据上,VL-RiskFormer实现了平均0.90的AUROC,预期校准误差为2.7个百分点。

关键词

引用

@article{arxiv.2509.18221,
  title  = {Multimodal Health Risk Prediction System for Chronic Diseases via Vision-Language Fusion and Large Language Models},
  author = {Dingxin Lu and Shurui Wu and Xinyi Huang},
  journal= {arXiv preprint arXiv:2509.18221},
  year   = {2025}
}