中文

弥合蛋白质比对统计模型中的鸿沟

机器学习 2020-10-05 v1 生物大分子 机器学习

摘要

本工作展示了如何由一个时间参数化替换矩阵和一个时间参数化三态比对机,构建出量化成对对齐蛋白质进化过程的完整统计模型。此类模型的所有参数均可从任意对齐蛋白质序列的基准数据集中推断得出。这使我们能够在六个使用不同结构比对方法整理的基准上检验九个著名的替换矩阵;任何未显式建模“时间”依赖马尔可夫过程的矩阵,均被转换为相应的基矩阵以使其如此。此外,针对六个基准各推断出一个新的最优矩阵。利用最小消息长度(MML)推断,从衡量每个基准的香农信息量角度对所有 15 个矩阵进行比较。由此得到一个新的、明显总体表现最佳的时间依赖马尔可夫矩阵 MMLSUM,及其关联的三态机,我们在本工作中分析了其性质。对于标准使用,从上述马尔可夫矩阵导出的 MMLSUM 系列(对数优势)评分矩阵可在 https://lcb.infotech.monash.edu.au/mmlsum 获取。

关键词

引用

@article{arxiv.2010.00855,
  title  = {Bridging the Gaps in Statistical Models of Protein Alignment},
  author = {Dinithi Sumanaweera and Lloyd Allison and Arun S. Konagurthu},
  journal= {arXiv preprint arXiv:2010.00855},
  year   = {2020}
}

备注

Main text: 15 pages, 4 Figs Supplementary text: 12 pages, 6 Figs