从 RNA-seq 数据快速准确近似推断转录本表达
摘要
动机:将 RNA-seq 读段分配到其来源转录本是转录本表达估计中的一项基本任务。当由于转录本共享序列(例如可变剪接异构体或等位基因)而存在分配歧义时,可通过概率推断解决该问题。贝叶斯方法已被证明能提供比竞争方法更准确的转录本丰度估计。然而,精确贝叶斯推断是难以处理的,通常使用近似方法,如马尔可夫链蒙特卡洛 (MCMC) 和变分贝叶斯 (VB)。尽管这些方法提供了高精度和建模灵活性,但标准实现在处理大数据集和复杂转录组注释时可能过于缓慢。结果:我们提出了一种基于 VB 的新型近似推断方案,并将其应用于一个现有的从 RNA-seq 数据推断转录本表达的模型。利用 VB 算法的最新进展,改进了算法的收敛性,超越了标准的变分贝叶斯期望最大化 (VBEM) 算法。我们将算法应用于模拟和生物数据集,证明速度显著提升,而表达水平估计的准确性损失极小。我们与七种流行的替代方法进行了比较研究,证明我们的新算法提供了出色的准确性和重复间一致性,同时在计算时间上保持竞争力。可用性:该方法用 R 和 C++ 实现,并作为 BitSeq 项目的一部分提供,网址为 https://github.com/BitSeq。该方法也可通过 BitSeq Bioconductor 包获取。用于重现所有模拟结果的源代码可通过 https://github.com/BitSeq/BitSeqVB_benchmarking 访问。
引用
@article{arxiv.1412.5995,
title = {Fast and accurate approximate inference of transcript expression from RNA-seq data},
author = {James Hensman and Panagiotis Papastamoulis and Peter Glaus and Antti Honkela and Magnus Rattray},
journal= {arXiv preprint arXiv:1412.5995},
year = {2015}
}
备注
Main changes: (a) shuffling of reads simulated from spanki and repeat the analysis for sailfish and eXpress. Now both methods yield better point estimates. (b) including the Markov chain Monte Carlo sampler of rsem (RSEM-PME). (c) including the Kallisto method (d) adding alternative measures of transcript expression (TPM) and filtering out low expressed transcripts (supplementary material). arXiv admin note: substantial text overlap with arXiv:1308.5953