中文

ReadsClean:一种基于比对聚类的测序读段纠错新方法

基因组学 2019-07-31 v1

摘要

动机:新一代 DNA 测序方法产生相对较高的读取错误率,干扰新测序生物的全新基因组组装,尤其影响对多种遗传病诊断至关重要的 SNP 检测质量。现有若干用于纠正 NGS 读段错误的程序。此类程序采用不同方法并针对不同的具体任务优化,但均远未能纠正所有错误,特别是在跨越重复序列的测序读段以及来自二倍体/多倍体真核生物基因组的 DNA 中。结果:本文描述了一种基于相似读段比对聚类的纠错新方法。该方法实现于 ReadsClean 程序,专为清洗 Illumina HiSeq 测序读段而设计。我们将 ReadsClean 与多篇文献公认最佳的其它读段清洗程序进行比较。使用实际与模拟测序读段的序列组装测试表明 ReadsClean 取得了更优结果。可用性与实现:ReadsClean 以独立 C 代码实现,已整合入纠错流程,并免费提供给学术用户于 Softberry 网络服务器 www.softberry.com 使用。

关键词

引用

@article{arxiv.1907.12718,
  title  = {ReadsClean: a new approach to error correction of sequencing reads based on alignments clustering},
  author = {Oleg Fokin and Anastasia Bakulina and Igor Seledtsov and Victor Solovyev},
  journal= {arXiv preprint arXiv:1907.12718},
  year   = {2019}
}

备注

13 pages, 2 figures, 9 tables, Supplemental information