中文

关于序列基序检测的权重矩阵与自由能模型

基因组学 2010-12-10 v2 应用统计

摘要

基序检测问题可以表述为构建一个判别函数,以将特定模式的序列从背景中分离出来。在计算生物学中,基序检测用于预测转录因子(TF)的DNA结合位点,主要基于权重矩阵(WM)模型或吉布斯自由能(FE)模型。然而,尽管应用广泛,对这两种模型及其预测的理论分析仍然缺乏。我们在不同的数据生成假设下推导了基于这些模型的预测过程的渐近错误率。这使得我们能够在渐近效率方面对基于WM和基于FE的预测进行理论比较。通过基于ChIP-seq数据和蛋白质结合微阵列数据的实证研究,展示了理论结果的应用。我们发现,无论底层数据生成机制如何,当用于构建判别决策的观测结合位点数量不太少时,FE方法相对于WM方法显示出更高或相当的可预测能力。

关键词

引用

@article{arxiv.1001.0341,
  title  = {On Weight Matrix and Free Energy Models for Sequence Motif Detection},
  author = {Qing Zhou},
  journal= {arXiv preprint arXiv:1001.0341},
  year   = {2010}
}

备注

23 pages, 1 figure and 4 tables