中文

通过惩罚估计和插补重建DNA拷贝数

统计方法学 2011-01-11 v5 基因组学 应用统计

摘要

基因组学的最新进展强调了DNA拷贝数变异(CNV)的惊人普遍性。幸运的是,现代基因分型平台也能以相当高的可靠性检测CNV。隐马尔可夫模型和算法在CNV数据的解释中发挥了主导作用。本文通过Tibshirani和Wang [Biostatistics 9 (2008) 18--29] 提出的融合套索惩罚估计来探索CNV重建。我们通过以下方式对这个困难的优化问题发起新的攻击:(a) 通过用绝对值函数的平滑近似替换惩罚项来略微改变惩罚项,(b) 设计并实现一种新的MM(主化-最小化)算法,以及(c) 应用牛顿法的快速版本联合更新所有模型参数。这些改变共同使我们能够以高效的方式最小化融合套索准则。我们还将重建问题重新表述为通过离散优化的插补问题。这种方法比参数估计更简单、更准确,因为它依赖于每个SNP位点仅存在少数可能的拷贝数状态这一事实。动态规划框架的额外好处是能够利用当前融合套索方法忽略的信息。我们的插补精度与隐马尔可夫模型相当,但计算成本显著降低。

关键词

引用

@article{arxiv.0906.2234,
  title  = {Reconstructing DNA copy number by penalized estimation and imputation},
  author = {Zhongyang Zhang and Kenneth Lange and Roel Ophoff and Chiara Sabatti},
  journal= {arXiv preprint arXiv:0906.2234},
  year   = {2011}
}

备注

Published in at http://dx.doi.org/10.1214/10-AOAS357 the Annals of Applied Statistics (http://www.imstat.org/aoas/) by the Institute of Mathematical Statistics (http://www.imstat.org)