中文

用于球数据的混合模型及其在蛋白质生物信息学中的应用

统计理论 2021-04-28 v1 统计理论

摘要

将有限混合模型拟合于球数据。混合模型的各分量采用Kent分布,因其具有相当大的灵活性。此前关于此类混合模型的工作对单一分量参数使用了近似最大似然估计量。然而,该近似在采用EM算法估计混合模型参数时会导致问题。因此,此处对各个分量使用精确最大似然估计量。本文受结构生物信息学中蛋白质如何折叠这一具挑战性的悬赏问题所推动。已知氢键在蛋白质折叠中起关键作用。我们利用描述蛋白质中两个氨基酸之间键的数据集来探索该氢键几何。提出了一种表示氢键几何的适当坐标系,将每个键表示为球上一点。我们对氢键数据的不同子集拟合Kent分布混合模型,以深入理解二级结构元件如何成键,因为氢键的分布依赖于所涉及的二级结构元件。

关键词

引用

@article{arxiv.2104.13140,
  title  = {Mixture models for spherical data with applications to protein bioinformatics},
  author = {Kanti V. Mardia and Stuart Barber and Philippa M. Burdett and John T. Kent and Thomas Hamelryck},
  journal= {arXiv preprint arXiv:2104.13140},
  year   = {2021}
}

备注

17 pages, 9 figures