中文

群体基因型的有限语言表示索引

数据结构与算法 2011-09-08 v4 计算工程、金融与科学 定量方法

摘要

随着 DNA 测序的最新进展,现在已能够对个体的完整基因组进行测序和组装。这些丰富且集中的基因型信息可用于进行各种群体范围的研究,这也是首次直接在全基因组水平上进行。我们提出了一种将群体基因型信息与完整基因组序列一起进行索引的方法,以便人们可以利用该索引高效地将给定序列与基因组进行比对,同时考虑到所有合理的基因型重组。这是通过将个体基因组的多重比对转换为有限自动机来实现的,该自动机识别所有可以通过在任何时刻切换序列而从比对中读出的字符串。该有限自动机使用 Burrows-Wheeler 变换的扩展进行索引,以允许在合理的重组序列内进行模式搜索。由于个体基因组之间的高度相似性,索引的大小保持有限。该索引在变异检测和引物设计中得到了应用。在一项变异检测实验中,仅通过精确匹配,我们就发现了约 1.0% 的匹配属于新重组体,而在近似匹配下高达 2.4%。

关键词

引用

@article{arxiv.1010.2656,
  title  = {Indexing Finite Language Representation of Population Genotypes},
  author = {Jouni Sirén and Niko Välimäki and Veli Mäkinen},
  journal= {arXiv preprint arXiv:1010.2656},
  year   = {2011}
}

备注

This is the full version of the paper that was presented at WABI 2011. The implementation is available at http://www.cs.helsinki.fi/group/suds/gcsa/