在 RNA-seq 重复序列的汪洋中导航而不致沉没
数据结构与算法
2014-06-05 v1 计算工程、金融与科学
定量方法
摘要
从头组装 NGS 数据的主要挑战无疑是处理长度超过读长(reads)的重复序列。对于 RNA-seq 数据而言,这一点尤为突出,因为无法利用覆盖度信息来标记重复序列,而转座子便是其中的主要例子之一。大多数转录组组装器基于 de Bruijn 图,缺乏针对 RNA-seq 数据中重复序列的清晰明确模型,转而依赖启发式方法进行处理。本工作的成果主要有两方面。首先,我们引入了一个形式化模型来表示 RNA-seq 数据中的高拷贝数重复序列,并利用其性质推断出与重复序列相关的子图的组合特征。我们证明了在 de Bruijn 图中识别具有该特征的子图问题是 NP 完全的。其次,我们表明在可变剪接(AS)事件的局部组装这一特定情况下,可以隐式地避开此类子图。具体而言,我们设计并实现了一种算法,以高效识别不包含在重复区域中的 AS 事件。最后,我们利用合成数据验证了我们的结果,并展示了该方法在真实数据上的实用性。
引用
@article{arxiv.1406.1022,
title = {Navigating in a sea of repeats in RNA-seq without drowning},
author = {Gustavo Sacomoto and Blerina Sinaimeri and Camille Marchet and Vincent Miele and Marie-France Sagot and Vincent Lacroix},
journal= {arXiv preprint arXiv:1406.1022},
year = {2014}
}