中文

基于预测自监督预训练的 CGM-JEPA:学习一致的连续血糖监测表示

机器学习 2026-05-05 v1 人工智能

摘要

连续血糖监测(CGM)可以检测早期代谢亚型(胰岛素抵抗,IR;β 细胞功能障碍),但在大规模部署中面临两个相互关联的问题。首先,相同的生理状态通过多种视图呈现(CGM 时间序列、血清 OGTT、Glucodensity 概览),因此单视图表示在部署 modality 或 setting 变化时难以迁移。其次,基线方法在这些变化下表现不一致。这两个问题指向一个解决方案:捕捉更高层次时序和分布结构的表示。我们提出 CGM-JEPA,一种自监督预训练框架,通过预测掩码后的潜在表示来实现抽象化,从而实现跨模态迁移。X-CGM-JEPA 引入掩码 Glucodensity 跨视图目标,以获取补充的分布信息。我们在约 38.9 万 条未标记的 CGM 记录(来自 228 名受试者)上进行预训练,并在两个临床队列(N=27 和 N=17 的公开子集)中评估,分别采用三种情景(队列泛化、血清转 CGM、居家 CGM),并采用 20 次迭代 × 2 折交叉验证。X-CGM-JEPA 在两个终点的所有三个情景中在 AUROC 上位列第一或第二,而没有任何基线方法如此做, cohort 泛化中超过最强基线提高了最高达 +6.5 百分点,血清转 CGM 迁移中提高了 +3.6 百分点(配对 Wilcoxon 检验,p<0.001)。在 modality 变化下,它保持平均 AUROC,同时向较弱子群(族群 AUROC 差距缩小 25-54%) redistributed;在稀疏的领域内血清数据上,分布视图提升了标签感知聚类(ARI 提升 +39%,NMI 提升 +40%)。代码与模型权重:https://github.com/cruiseresearchgroup/CGM-JEPA

关键词

引用

@article{arxiv.2605.00933,
  title  = {CGM-JEPA: Learning Consistent Continuous Glucose Monitor Representations via Predictive Self-Supervised Pretraining},
  author = {Hada Melino Muhammad and Zechen Li and Flora Salim and Ahmed A. Metwally},
  journal= {arXiv preprint arXiv:2605.00933},
  year   = {2026}
}