中文

脂肪指数遗传变异鉴别:知识集成分位回归 (KIQR) 方法用于超高维数据

应用统计 2026-03-31 v3 统计方法学

摘要

脂肪性状广为人知为严重且普遍的健康问题。我们通过体质指数 (BMI) 研究脂肪,其高度遗传,并从 Framingham 研究数据中从数十万个单核苷酸多态性 (SNP) 中识别重要的遗传风险因子。使用传统基因组-wide 关联研究 (GWAS) 时存在以下挑战:(1) 由于受限的样本数量和严格的基因组-wide 显著性阈值,统计检验功效较低;(2) 来自大型 meta-分析的既有先验知识可为导引提供宝贵线索,但往往未得到充分利用;(3) 单变量边际回归框架忽略了遗传效应的联合与条件性;(4) GWAS 仅关注均值结果,而脂肪本质上关乎异常偏高的 BMI 水平。为此,我们提出一种新的知识集成分位回归 (KIQR) 方法,通过联合变量选择与估计来进行分析,聚焦于 BMI 的条件高分位点,这些分位点与脂肪风险最相关,并整合来自 GIANT 联盟和 UK Biobank 等大型研究的先验信息。值得注意的是,我们识别了几个有前景的新关联位点:rs3798696 位于 \textit{TFAP2A}、rs7070523 位于 \textit{ITIH5}、rs178260 位于 \textit{AIFM3},这些位点在 GWAS 文献中尚未被报道。这些发现为理解脂肪的遗传结构提供了新视角,表明基于分位点的建模与整合先验知识可潜在发现传统 GWAS 方法遗漏的新基因。R 语言实现及仿真脚本已公开于 https://github.com/KIQR-submission/KIQR。

关键词

引用

@article{arxiv.2406.12212,
  title  = {Identifying Genetic Variants for Obesity: A Knowledge Integration Quantile Regression (KIQR) Approach for Ultra-High-Dimensional Data},
  author = {Jiantong Wang and Heng Lian and Yan Yu and Tianhai Zu and Heping Zhang},
  journal= {arXiv preprint arXiv:2406.12212},
  year   = {2026}
}