中文

序列表型推断的拼图:拼合香农熵、重要性采样与经验贝叶斯

定量方法 2015-06-15 v2

摘要

一个长度为 35 个碱基对的核苷酸序列可能有 1,180,591,620,717,411,303,424 种可能的取值。系统生物学数据集的一个示例——蛋白质结合微阵列,包含了约 40000 个此类序列的活性数据。可能构型的数量与可用活性数据之间的差异巨大。因此,尽管系统生物学数据集在绝对数量上很大,但由于生物系统可能构型数量的组合式增加,它们通常需要使用为稀有事件开发的方法。文献中已开发了多种处理大数据集(如经验贝叶斯)或稀有事件(如重要性采样)的技术,但这些技术并不总能同时利用。在此,我们在序列表型模型归纳的一般背景下,引入了一种基于重要性采样、信息论和理论物理的经验贝叶斯原则性方法。我们展示了支撑该方法的分析计算。我们在具体示例上证明了该方法的计算效率,并通过将其应用于公开的蛋白质结合微阵列转录因子数据集和合成 cAMP 调节增强子序列数据,证明了其有效性。作为进一步的演示,我们发现了转录因子结合基序,预测了新序列的活性,并提取了转录因子结合位点的位置。总之,我们提出了一种新方法,该方法高效(需要极少的计算时间和合理的内存量),具有高预测能力(可与具有数百个参数的模型相媲美),且优化参数数量有限,与序列长度成正比。

关键词

引用

@article{arxiv.1312.4576,
  title  = {The jigsaw puzzle of sequence phenotype inference: Piecing together Shannon entropy, importance sampling, and Empirical Bayes},
  author = {Zeina Shreif and Deborah A. Striegel and Vipul Periwal},
  journal= {arXiv preprint arXiv:1312.4576},
  year   = {2015}
}

备注

61 pages