选择调整推断:在顺式 eQTL 效应量置信区间中的应用
应用统计
2018-06-08 v2
摘要
eQTL 研究的目标是识别影响生物体内基因表达水平的遗传变异。高通量技术使此类研究成为可能:在给定的组织样本中,它能够量化约 20,000 个基因的表达水平,并记录数百万个遗传多态性位点上的等位基因。尽管一旦获得样本,获取这些数据相对廉价,但获取人体组织仍然是一项昂贵的努力。因此,eQTL 研究继续基于相对较小的样本量,这一限制对于最具直接医学相关性的组织尤为严重。鉴于此类数据集的高维性质以及所检验的大量假设,科学界很早就采用了多重性调整程序,主要控制识别影响表达水平的遗传变异的假发现率。相比之下,迄今为止未受到太多关注的一个问题是:以提供与这些变异相关的效应量估计的方式,对相当程度的筛选加以考量。我们说明了如何部署最近开发的条件推断方法,以获得具有可靠覆盖率的 eQTL 效应量置信区间。我们提出的程序基于一种随机化分层策略,该策略既反映了最先进研究中通常采用的步骤,又引入了随机性而非数据拆分,以最大化可用数据的利用。对 GTEx Liver 数据集(v6)的分析表明,朴素获得的置信区间可能不能覆盖效应量的真实值,且影响基因表达水平的局部遗传多态性数量可能被低估。
引用
@article{arxiv.1801.08686,
title = {Selection-adjusted inference: an application to confidence intervals for cis-eQTL effect sizes},
author = {Snigdha Panigrahi and Junjie Zhu and Chiara Sabatti},
journal= {arXiv preprint arXiv:1801.08686},
year = {2018}
}