中文

面向协作式全基因组关联研究的联邦广义线性混合模型

统计方法学 2022-10-04 v1 基因组学

摘要

随着测序成本的下降,开展大规模关联研究以提升检测新变异的功效具有极大动力。不同机构间的联邦关联检验通过共享由中央服务器聚合的中间检验统计量来增加样本量,是一种可行的解决方案。然而,开展联邦关联检验仍存在诸多挑战。已知关联检验会受到群体分层等众多因素的混淆,这在多祖先研究和不同站点间的混合人群中尤为重要。此外,应通过灵活的模型考虑疾病病因,以避免遗传效应显著性中的偏倚。开展大规模关联研究的一个新兴挑战是参与者的隐私以及相关污名化与边缘化的伦理问题。在此,我们提出 dMEGA,一种灵活且高效的方法,用于在多个站点间开展基于联邦广义线性混合模型的关联检验,同时不显式共享底层基因型和表型数据。dMEGA 首先利用参考投影在不共享基因型数据集的情况下估计基于群体的协变量。接着,dMEGA 使用拉普拉斯近似处理参数似然,并将参数估计分解为站点间高效的局部梯度更新。我们使用模拟和真实数据集来证明 dMEGA 的准确性和效率。总体而言,dMEGA 的公式可灵活地在联邦设定中整合固定效应和随机效应。

关键词

引用

@article{arxiv.2210.00395,
  title  = {Federated Generalized Linear Mixed Models for Collaborative Genome-wide Association Studies},
  author = {Wentao Li and Han Chen and Xiaoqian Jiang and Arif Harmanci},
  journal= {arXiv preprint arXiv:2210.00395},
  year   = {2022}
}