中文

利用分布的峰值与趋势聚类人类 DNA 中的基因组词

应用统计 2021-01-13 v1

摘要

在这项工作中,我们通过研究人类 DNA 中基因组词的词间滞后分布来寻找基因组词的聚类。由于这些直方图的显著尖峰性质,我们提出了一种聚类流程,首先将该分布分解为基线分布与峰值分布。使用一种离群鲁棒拟合方法来估计基线分布(即“趋势”),而一个稀疏的去趋势数据向量捕捉峰值结构。一项仿真研究证明了该聚类流程在按相似峰值行为和/或基线特征对分布进行分组方面的有效性。该流程被应用于探究人类基因组中长度为 3 和 5 的基因组词分布模式之间的相似性。这些实验展示了新方法在识别具有相似距离模式的词方面的潜力。

关键词

引用

@article{arxiv.1808.04278,
  title  = {Clustering genomic words in human DNA using peaks and trends of distributions},
  author = {Ana Helena Tavares and Jakob Raymaekers and Peter J. Rousseeuw and Paula Brito and Vera Afreixo},
  journal= {arXiv preprint arXiv:1808.04278},
  year   = {2021}
}