中文

在 RNA-seq 重复序列的汪洋中导航而不致沉没

数据结构与算法 2014-06-05 v1 计算工程、金融与科学 定量方法

摘要

从头组装 NGS 数据的主要挑战无疑是处理长度超过读长(reads)的重复序列。对于 RNA-seq 数据而言,这一点尤为突出,因为无法利用覆盖度信息来标记重复序列,而转座子便是其中的主要例子之一。大多数转录组组装器基于 de Bruijn 图,缺乏针对 RNA-seq 数据中重复序列的清晰明确模型,转而依赖启发式方法进行处理。本工作的成果主要有两方面。首先,我们引入了一个形式化模型来表示 RNA-seq 数据中的高拷贝数重复序列,并利用其性质推断出与重复序列相关的子图的组合特征。我们证明了在 de Bruijn 图中识别具有该特征的子图问题是 NP 完全的。其次,我们表明在可变剪接(AS)事件的局部组装这一特定情况下,可以隐式地避开此类子图。具体而言,我们设计并实现了一种算法,以高效识别不包含在重复区域中的 AS 事件。最后,我们利用合成数据验证了我们的结果,并展示了该方法在真实数据上的实用性。

关键词

引用

@article{arxiv.1406.1022,
  title  = {Navigating in a sea of repeats in RNA-seq without drowning},
  author = {Gustavo Sacomoto and Blerina Sinaimeri and Camille Marchet and Vincent Miele and Marie-France Sagot and Vincent Lacroix},
  journal= {arXiv preprint arXiv:1406.1022},
  year   = {2014}
}