中文

SnakeLines:用于测序读段的集成计算流水线集合

基因组学 2021-06-28 v1 计算工程、金融与科学

摘要

背景:随着大规模并行测序技术的快速增长,越来越多实验室利用测序DNA片段进行基因组分析。然而,测序数据的解读强烈依赖于生物信息学处理,这对无计算背景的临床医生与研究者往往要求过高。另一问题是跨分离计算中心的计算分析可重复性,因其所装库与生物信息学工具版本不一致。结果:我们提出一套易扩展的计算流水线SnakeLines,用于处理测序读段;包括映射、组装、变异检测、病毒鉴定、转录组学、宏基因组学与甲基化分析。分析的各步骤及其方法与参数可在单一配置文件中轻松修改。所提供的流水线嵌入虚拟环境,确保所需资源与宿主操作系统隔离、快速部署及跨不同类Unix平台的分析可重复性。结论:SnakeLines是生物信息学分析自动化的强大框架,强调简易设置、修改、可扩展性与可重复性。关键词:计算流水线,框架,大规模并行测序,可重复性,虚拟环境

关键词

引用

@article{arxiv.2106.13649,
  title  = {SnakeLines: integrated set of computational pipelines for sequencing reads},
  author = {Jaroslav Budis and Werner Krampl and Marcel Kucharik and Rastislav Hekel and Adrian Goga and Michal Lichvar and David Smolak and Miroslav Bohmer and Andrej Balaz and Frantisek Duris and Juraj Gazdarica and Katarina Soltys and Jan Turna and Jan Radvanszky and Tomas Szemes},
  journal= {arXiv preprint arXiv:2106.13649},
  year   = {2021}
}

备注

22 pages, 3 figures, 1 table