中文

带邻接约束的带状相似矩阵层次聚类及其在基因组学中的应用

统计理论 2019-02-06 v1 定量方法 统计理论

摘要

动机:基因组数据分析,如全基因组关联研究(GWAS)或 Hi-C 研究,常常面临基于高分辨率位点水平测量的相似矩阵将染色体划分为连续区域的问题。一种直观的做法是执行改进的层次凝聚聚类(HAC),其中仅允许相邻簇(依据染色体内部位置顺序)合并。该方法的一个主要实际缺陷是其关于位点数量的二次时间和空间复杂度,而每个染色体的位点数量通常在 10^4 到 10^5 量级。结果:通过假设物理上相距遥远的对象之间的相似性可忽略,我们提出了一种具有拟线性复杂度的带邻接约束 HAC 实现。我们在 GWAS 和 Hi-C 数据集上的示例证明了该假设的合理性,并表明该方法能突出具有生物学意义的信号。由于其较小的时空占用,该方法可在标准笔记本电脑上于数分钟甚至数秒内运行。可用性与实现:软件和样本数据以 R 包 adjclust 的形式提供,可从 Comprehensive R Archive Network (CRAN) 下载。

关键词

引用

@article{arxiv.1902.01596,
  title  = {Adjacency-constrained hierarchical clustering of a band similarity matrix with application to Genomics},
  author = {Christophe Ambroise and Alia Dehman and Pierre Neuvial and Guillem Rigaill and Nathalie Vialaneix},
  journal= {arXiv preprint arXiv:1902.01596},
  year   = {2019}
}