中文

用于测序数据遗传关联分析的加权 U 统计量

统计方法学 2025-08-18 v1 人工智能 机器学习 定量方法

摘要

随着下一代测序技术的进步,产生了海量测序数据,为全面研究罕见变异在复杂疾病遗传病因中的作用提供了绝佳机会。然而,这对高维测序数据的统计分析提出了巨大挑战。基于传统统计方法的关联分析由于遗传变异的低频性和数据的极高维性而遭受显著的功效损失。我们开发了一种称为 WU-seq 的加权 U 统计量,用于测序数据的高维关联分析。基于非参数 U 统计量,WU-seq 不对潜在疾病模型和表型分布作任何假设,并可应用于多种表型。通过模拟研究和实证研究,我们表明当底层假设被违背时(例如表型服从重尾分布),WU-seq 优于常用的 SKAT 方法。即使假设成立,WU-seq 仍取得了与 SKAT 相当的性能。最后,我们将 WU-seq 应用于达拉斯心脏研究(DHS)的测序数据,并检测到 ANGPTL4 与极低密度脂蛋白胆固醇之间的关联。

关键词

引用

@article{arxiv.1505.01204,
  title  = {A Weighted U Statistic for Genetic Association Analyses of Sequencing Data},
  author = {Changshuai Wei and Ming Li and Zihuai He and Olga Vsevolozhskaya and Daniel J. Schaid and Qing Lu},
  journal= {arXiv preprint arXiv:1505.01204},
  year   = {2025}
}