用于短序列比对的期望最大化(EM)算法——以FAIRE数据和TP53-WRAP53基因区域为例
基因组学
2009-12-31 v1 定量方法
摘要
目前产生了海量的短序列读段,用于比对回基因组,以发现转录本、miRNA、DNA酶超敏感位点、FAIRE区域、核小体占据等的频率。由于这些读段通常很短(例如36个碱基对),并且包括人类在内的许多真核生物基因组具有高度重复序列,因此许多读段会比对到基因组的两个或多个位置。当前对这些读段的比对,根据0、1或2个错配进行分级,浪费了大量信息。这些短序列的比对通常不考虑序列的准确性,即使在机器另一部分报告每个碱基错误率的公司软件中也是如此。此外,多重比对位置经常被完全丢弃,或者在不考虑其他读段积累位置的情况下进行分配。在这里,我们展示了如何将读段的概率比对与EM算法相结合,以迭代方式提高短序列读段分配的经验似然。使用LAST进行比对时,会考虑读段的每个碱基准确性,以及插入和缺失,还有相对于亲本基因组的预期偶发错误或SNP。概率EM算法基于前一个循环中窗口内比对的读段比例,以及关于读段最佳比对位置的任何先验信息,迭代地分配读段。这些方法通过FAIRE ENCODE数据进行了说明,该数据关注的是TP53和WRAP53这一非常重要的头对头基因组合。
引用
@article{arxiv.0912.5315,
title = {Expectation-Maximization (EM) Algorithms for Mapping Short Reads Illustrated with FAIRE data and the TP53-WRAP53 Gene Region},
author = {Peter J. Waddell and Timothy Herston},
journal= {arXiv preprint arXiv:0912.5315},
year = {2009}
}
备注
17 pages, 3 figures, 1 table all incorporated in one pdf