中文

一种用于识别临床显著性遗传变异的高效充分降维方法

基因组学 2013-01-17 v1 机器学习 机器学习

摘要

快速且廉价的下一代测序技术将产生前所未有的海量且高维的基因组和表观基因组变异数据。在不久的将来,医疗记录的常规部分将包含测序的基因组。一个基本问题是如何高效提取具有临床实用性的基因组和表观基因组变异,从而为最佳健康和干预策略提供信息。识别具有临床有效性变异的传统范式是检验变异的关联性。然而,显著相关的遗传变异对于疾病的诊断和预后可能有用,也可能无用。寻找具有预测效用遗传变异的关联研究的替代方案,是系统性地搜索包含用于表型预测的充分信息的变异。为此,我们引入了充分降维和坐标假设的概念,将原始高维数据投影到极低维空间,同时保留关于响应表型的所有信息。然后,我们将临床显著性遗传变异发现问题转化为稀疏 SDR 问题,并开发了能够从多达甚至上千万预测因子中选择显著性遗传变异的算法,其通过将全基因组的 SDR 划分为为基因组区域定义的若干子 SDR 问题来实现。稀疏 SDR 随后被转化为稀疏最优评分问题,但带有可从基矩阵中移除行向量的惩罚项。为了加速计算,我们开发了修正的乘子交替方向法来求解稀疏最优评分问题,该方法可轻松并行实现。为了说明其应用,将所提出的方法应用于模拟数据和 NHLBI 的外显子组测序项目数据集。

关键词

引用

@article{arxiv.1301.3528,
  title  = {An Efficient Sufficient Dimension Reduction Method for Identifying Genetic Variants of Clinical Significance},
  author = {Momiao Xiong and Long Ma},
  journal= {arXiv preprint arXiv:1301.3528},
  year   = {2013}
}