中文

评估无监督解耦表示学习在基因组发现与疾病风险预测中的表现

机器学习 2023-07-19 v1 基因组学 机器学习

摘要

由于生物样本库规模数据集中此类数据易于获取,以及特别是基于深度学习的高性能建模技术的发展,高维临床数据已成为遗传学研究中的宝贵资源。近期工作表明,由变分自编码器(VAE)学习的这些临床数据的低维嵌入可用于全基因组关联研究与多基因风险预测。在本工作中,我们考虑多种用于学习解耦表示的无监督学习方法,即自编码器、VAE、beta-VAE 与 FactorVAE,并将其置于遗传关联研究的背景下。以英国生物样本库(UK Biobank)的 spirogram(肺活量图)作为示例,我们观察到,相较于标准 VAE 或非变分自编码器,使用 FactorVAE 或 beta-VAE 在哮喘与慢性阻塞性肺疾病的全基因组显著位点数量、遗传力以及多基因风险评分表现上均有改善。FactorVAE 在正则化超参数的多个取值下均表现有效,而 beta-VAE 对超参数取值则敏感得多。

关键词

引用

@article{arxiv.2307.08893,
  title  = {Evaluating unsupervised disentangled representation learning for genomic discovery and disease risk prediction},
  author = {Taedong Yun},
  journal= {arXiv preprint arXiv:2307.08893},
  year   = {2023}
}

备注

Accepted to the 2023 ICML Workshop on Computational Biology. Honolulu, Hawaii, USA, 2023