SNPgen:基于潜在扩散的表型监督基因型表示与合成数据生成
机器学习
2026-03-12 v1 基因组学
摘要
多基因风险得分及其他基因组分析需要大规模individual-level基因型数据集,但严格的数据访问限制阻碍了共享。合成基因型生成提供了一种隐私保护的替代方案,但大多数现有方法是无条件生成样本,缺乏表型对齐,或依赖无监督压缩,导致统计保真度与下游任务实用性之间存在差距。我们提出SNPgen,一个用于生成表型监督合成基因型的两阶段条件潜在扩散框架。SNPgen将GWAS引导的变异选择(1024-2048个与疾病相关的SNP)与变分自编码器结合,用于基因型压缩,并通过classifier-free guidance在二元疾病标签条件下构建潜在扩散模型。我们在458,724名UK Biobank个体(涵盖冠心病、乳腺癌、1型和2型糖尿病四种复杂疾病)上进行评估,在train-on-synthetic, test-on-real协议下,模型在预测性能上与真实数据相当,接近使用2-6倍更多变位的全基因组PRS方法。隐私分析确认零个完全相同的匹配项,近乎随机的成员推断(AUC≈0.50),保持链位联系的结构,以及与源数据高度等位频率相关性()。一个受控仿真验证了对已知因果效应的忠实恢复。
关键词
引用
@article{arxiv.2603.10873,
title = {SNPgen: Phenotype-Supervised Genotype Representation and Synthetic Data Generation via Latent Diffusion},
author = {Andrea Lampis and Michela Carlotta Massi and Nicola Pirastu and Francesca Ieva and Matteo Matteucci and Emanuele Di Angelantonio},
journal= {arXiv preprint arXiv:2603.10873},
year = {2026}
}