中文

用于函数型数据聚类与基序发现的概率 K-均值局部比对方法

统计方法学 2023-01-30 v2

摘要

我们开发了一种新方法,用于局部聚类曲线并发现函数型基序,即可能沿曲线及跨曲线多次出现的典型“形状”,捕捉重要的局部特征。为识别这些共享曲线片段,我们的方法借鉴了函数型数据分析(曲线的联合聚类与对齐)、生物信息学(通过高相似种子扩展的局部比对)和模糊聚类(若曲线包含多于一种典型“形状”,则可属于多个簇)的思想。它可采用多种相异度度量,并在发现过程中纳入导数,从而利用形状的复杂特征。我们通过广泛的模拟研究展示了方法的性能,并说明它如何推广其他函数型数据聚类方法。最后,我们给出了针对 Berkeley 生长数据、意大利 Covid-19 死亡曲线以及与诱变相关的“Omics”数据的实际应用。

关键词

引用

@article{arxiv.1808.04773,
  title  = {Probabilistic $K$-mean with local alignment for clustering and motif discovery in functional data},
  author = {Marzia A. Cremona and Francesca Chiaromonte},
  journal= {arXiv preprint arXiv:1808.04773},
  year   = {2023}
}

备注

22 pages, 6 figures. This work has been presented at various conferences