中文

用于比较两个基因组排序列表的生存 Copula 混合模型

统计方法学 2013-11-28 v1

摘要

高通量基因组数据的分析通常导致基因组位点的排序列表。如何刻画两个排序列表之间的一致信号是一个具有许多应用的常见问题。一个例子是测量两个重复实验之间的可重复性。另一个是基于两个转录因子 (TF) 结合位点的重叠来刻画它们之间的相互作用和共结合。作为一种探索性工具,简单的维恩图方法可用于显示两个列表之间的共同位点。然而,这种方法没有考虑随排序下降而发生的重叠变化,这可能包含用于研究两个列表相似性或差异性的有用信息。最近提出的不可重复发现率 (IDR) 方法使用 copula 混合模型比较两个排序列表。该模型考虑了两个列表之间的排序相关性。然而,它仅分析出现在两个列表中的基因组位点,从而仅测量两个列表重叠集中信号的一致性。当两个列表重叠很少但重叠集中的位点在排序方面具有高度一致性时,原始 IDR 方法可能会误导性地声称这两个排序列表具有高度可重复性,而事实并非如此。在本文中,我们提议通过将问题转化为双变量生存问题来解决上述各种问题。开发了一种生存 copula 混合模型来刻画两个排序列表中的一致信号。通过模拟和真实数据证明了该方法的有效性。

关键词

引用

@article{arxiv.1311.7122,
  title  = {A Survival Copula Mixture Model for Comparing Two Genomic Rank Lists},
  author = {Yingying Wei and Hongkai Ji},
  journal= {arXiv preprint arXiv:1311.7122},
  year   = {2013}
}